Analisis Performa IndoBERT sebagai Feature Extractor dan SVM sebagai Classifier dalam Klasifikasi Multilabel Topik Hadits Terjemahan Bahasa Indonesia

Penulis

  • Abiyyu Abdurrafi Ahmad
  • Kemas Muslim Lhaksmana

Abstrak

Hadits sebagai sumber ajaran Islam memiliki kandungan makna yang beragam, seperti anjuran, larangan, dan informasi. Pada era digital, teks hadits terjemahan beredar luas tanpa anotasi topik yang jelas, sehingga menyulitkan pembaca dalam memahami pesan yang terkandung. Kondisi ini menimbulkan kebutuhan akan sistem klasifikasi otomatis yang mampu menangani lebih dari satu kategori makna dalam satu teks. Penelitian ini mengusulkan kombinasi IndoBERT sebagai ekstraktor fitur dan Support Vector Machine (SVM) sebagai pengklasifikasi untuk tugas klasifikasi multilabel topik hadits terjemahan Bahasa Indonesia. Pendekatan ini dipilih karena IndoBERT mampu menghasilkan representasi kontekstual yang kaya, sementara SVM efektif dalam memproses fitur berdimensi tinggi secara efisien. Tahapan penelitian mencakup praproses teks, ekstraksi embedding IndoBERT menggunakan strategi pooling CLS, mean, dan max, pelatihan model SVM, serta evaluasi menggunakan Hamming Loss, Micro F1, dan Macro F1. Hasil menunjukkan bahwa strategi mean pooling memberikan performa terbaik, dengan nilai Macro F1 mencapai 0.71649 dan mengungguli baseline TF-IDF + SVM. Temuan ini membuktikan bahwa pemanfaatan embedding IndoBERT dapat meningkatkan pemerataan performa antar label dan efektif digunakan dalam klasifikasi multilabel teks hadits.

Kata kunci— klasifikasi multilabel, hadits, IndoBERT, SVM, ekstraksi fitur, NLP

Referensi

W. Hu, Q. Fan, H. Yan, X. Xu, S. Huang, dan K. Zhang, “A Survey of Multi-Label Text Classification Under Few-Shot Scenarios,” Appl. Sci., vol. 15, no. 16, hlm. 8872, Agu 2025, doi: 10.3390/app15168872.

S. P. K. Veeranki, A. Abdulnazar, D. Kramer, M. Kreuzthaler, dan D. B. Lumenta, “Multi-label text classification via secondary use of large clinical real-world data sets,” Sci. Rep., vol. 14, no. 1, hlm. 26972, Nov 2024, doi: 10.1038/s41598-024-76424-8.

J. Devlin, M.-W. Chang, K. Lee, dan K. Toutanova, “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding,” dipresentasikan pada Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Minneapolis, Minnesota: Association for Computational Linguistics, 2019, hlm. 4171–4186.

A. Vaswani dkk., “Attention Is All You Need,” dipresentasikan pada Neural Information Processing Systems, Long Beach, CA, USA, 2017, hlm. 5998–6008.

H. Ahmadian, T. F. Abidin, H. Riza, dan K. Muchtar, “Transformer-Based Indonesian Language Model for Emotion Classification and Sentiment Analysis,” dalam 2023 International Conference on Information Technology and Computing (ICITCOM), Yogyakarta, Indonesia: IEEE, Des 2023, hlm. 209–214. doi: 10.1109/ICITCOM60176.2023.10442970.

F. Koto, A. Rahimi, J. H. Lau, dan T. Baldwin, “IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP,” 2020, arXiv. doi: 10.48550/ARXIV.2011.00677.

A. Kusumaningrum, S. A. Faraby, dan A. Adiwijaya, “Klasifikasi Informasi, Anjuran dan Larangan pada Hadits Shahih Bukhari menggunakan Metode Support Vector Machine,” E-Proceeding Eng., vol. 4, hlm. 5014–5023, Des 2017.

A. Wiraguna dan S. A. Faraby, “Klasifikasi Topik Multi Label pada Hadis Bukhari dalam Terjemahan Bahasa Indonesia Menggunakan Random Forest,” E-Proceeding Eng., vol. 6, hlm. 2144–2153, Apr 2019.

M. Y. A. Bakar dan A. Adiwijaya, “Klasifikasi Teks Hadis Bukhari Terjemahan Indonesia Menggunakan Recurrent Convolutional Neural Network (CRNN),” J. Teknol. Inf. Dan Ilmu Komput., vol. 8, no. 5, hlm. 907, Okt 2021, doi: 10.25126/jtiik.2021853750.

A. Maiti, A. Abarda, dan M. Hanini, “The impact of feature extraction techniques on the performance of text data classification models,” Indones. J. Electr. Eng. Comput. Sci., vol. 35, no. 2, hlm. 1041, Agu 2024, doi: 10.11591/ijeecs.v35.i2.pp1041-1052.

S. Minaee, N. Kalchbrenner, E. Cambria, N. Nikzad, M. Chenaghlu, dan J. Gao, “Deep Learning--based Text Classification: A Comprehensive Review,” ACM Comput. Surv., vol. 54, no. 3, hlm. 1–40, Apr 2022, doi: 10.1145/3439726.

P. Aggarwal dan R. Mahajan, “Shielding Social Media: BERT and SVM Unite for Cyberbullying Detection and Classification,” J. Inf. Syst. Inform., vol. 6, no. 2, hlm. 607–623, Jun 2024, doi: 10.51519/journalisi.v6i2.692.

N. K. Nissa dan E. Yulianti, “Multi-label text classification of Indonesian customer reviews using bidirectional encoder representations from transformers language model,” Int. J. Electr. Comput. Eng. IJECE, vol. 13, no. 5, hlm. 5641, Okt 2023, doi: 10.11591/ijece.v13i5.pp5641-5652.

F. Koto, J. H. Lau, dan T. Baldwin, “IndoBERTweet: A Pretrained Language Model for Indonesian Twitter with Effective Domain-Specific Vocabulary Initialization,” 10 September 2021, arXiv: arXiv:2109.04607. doi: 10.48550/arXiv.2109.04607.

C. Cortes dan V. Vapnik, “Support-vector networks,” Mach. Learn., vol. 20, no. 3, hlm. 273–297, Sep 1995, doi: 10.1007/BF00994018.

D. F. Surianto, M. Fajar B, M. R. Mulia, dan I. Indanasufya, “Comparative Analysis of the Performance of Hadith Text Classification Methods: A Case Study with ANN and SVM,” J. Embed. Syst. Secur. Intell. Syst., hlm. 89–98, Mar 2024, doi: 10.59562/jessi.v5i1.2942.

Unduhan

Diterbitkan

2026-07-01

Terbitan

Bagian

Prodi S1 Informatika