Analisis Komparasi Algoritma Supervised Machine Learning (Random Forest vs Naive Bayes) untuk Klasifikasi Kekuatan Password Berbasis Pola Karakter

Penulis

  • Quinta Bilqis Kharisma
  • Farah Afianti
  • Abdullah Hanifan

Abstrak

Di era digital saat ini, keamanan password masih menjadi masalah krusial, di mana berbagai insiden keamanan sering kali disebabkan oleh password yang lemah. Penelitian ini melakukan perbandingan antara algoritma Random Forest dan Naive Bayes dalam mengklasifikasikan kekuatan password berdasarkan pola karakter, dengan Shannon Entropy sebagai acuan dasar. Dataset yang digunakan terdiri dari 50.000 password yang diklasifikasikan ke dalam tiga kategori (weak, medium, strong), dengan ekstraksi 24 fitur yang mencakup aspek struktural, statistik, dan leksikal. Evaluasi dilakukan pada berbagai skenario pembagian data (80:20, 70:30, 50:50) menggunakan metrik akurasi, presisi, recall, F1-score, waktu inferensi, serta jejak memori. Hasilnya menunjukkan bahwa Random Forest mencapai akurasi sebesar 99,98% dengan waktu inferensi 0,0629 ms per prediksi, yang lebih unggul dibandingkan Naive Bayes (86,09%, 0,0011 ms) dan Shannon Entropy (82,73%). Uji McNemar mengonfirmasi bahwa perbedaan performa ini signifikan secara statistik (p < 0,0001). Analisis kesalahan mengungkapkan bahwa Naive Bayes mengalami penurunan performa hingga 21,24% pada password dengan pola kompleks karena keterbatasan asumsi independensi fitur. Fitur utama yang membedakan meliputi panjang password (32,06%), skor kompleksitas (22,37%), dan entropi (10,67%). Kedua model ini cocok untuk implementasi real-time dengan waktu inferensi di bawah 10 ms. Random Forest direkomendasikan untuk aplikasi keamanan kritis, sedangkan Naive Bayes lebih sesuai untuk sistem berskala besar dengan batasan latensi yang ketat.

Kata kunci— klasifikasi password, machine learning, random forest, naive bayes, keamanan siber, validasi real-time

Referensi

P. A. Grassi, M. E. Garcia, and J. L. Fenton, "Digital Identity Guidelines: Authentication and Lifecycle Management," NIST Special Publication 800-63B, National Institute of Standards and Technology, June 2020.

J. Bonneau, C. Herley, P. C. van Oorschot, and F. Stajano, "The Quest to Replace Passwords: A Framework for Comparative Evaluation of Web Authentication Schemes," in 2012 IEEE Symposium on Security and Privacy, San Francisco, CA, USA, 2012, pp. 553-567.

Verizon, "2023 Data Breach Investigations Report," Verizon Enterprise Solutions, 2023. [Online]. Available: https://www.verizon.com/business/resources/reports/dbir/

D. Wang, Z. Zhang, P. Wang, J. Yan, and X. Huang, "Targeted Online Password Guessing: An Underestimated Threat," in Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security, Vienna, Austria, 2016, pp. 1242-1254.

M. Dell'Amico, P. Michiardi, and Y. Roudier, "Password Strength: An Empirical Analysis," in IEEE INFOCOM 2010, San Diego, CA, USA, 2010, pp. 1-9.

T. Hastie, R. Tibshirani, and J. Friedman, The Elements of Statistical Learning: Data Mining, Inference, and Prediction, 2nd ed., New York: Springer, 2020.

P7. Jha, H. Hamid, O. Olukola, and N. Rahimi, "Adversarial Machine Learning for Robust Password Strength Estimation," IEEE Access, vol. 13, pp. 12450-12465, Jan. 2025.

Y. Zhang, Z. Hou, Y. Zou, Z. Li, and D. Wang, "EditPSM: A New Password Strength Meter Based on Password Reuse via Deep Learning," IEEE Transactions on Dependable and Secure Computing, vol. 22, no. 2, pp. 456-470, Feb. 2025.

K. Patel, M. Shah, R. Gupta, and S. Mehta, "Password Strength Classification Using Machine Learning Methods," in Proc. 2024 Int. Conf. Intell. Comput. Commun. (ICICC), Mumbai, India, Dec. 2024, pp. 112-117.

W. Chen, Y. Liu, and H. Wang, "Machine Learning Approaches for Password Strength Evaluation: A Comparative Study," ACM Computing Surveys, vol. 56, no. 3, Art. 45, pp. 1-35, Mar. 2023.

C. M. Bishop, Pattern Recognition and Machine Learning, New York: Springer, 2020.

Unduhan

Diterbitkan

2026-07-01

Terbitan

Bagian

Prodi S1 Informatika