Model Hybrid Clustering untuk Artikel Ilmiah Prosiding SENATIB Berbasis TF-IDF

Authors

  • Nabila Wahyu Ningtias Universitas Duta Bangsa
  • Abdullah Azza Al Abllas Universitas Duta Bangsa
  • Arif Kurniawan Universitas Duta Bangsa
  • Nasywa Hamna Zakiya Universitas Duta Bangsa
  • Aprilisa Arum Universitas Duta Bangsa

Keywords:

text mining, TF-IDF, K-Means Clustering, Agglomerative Hierarchical Clustering, SENATIB

Abstract

Meningkatnya jumlah artikel ilmiah pada prosiding Seminar Nasional Teknologi Informasi dan Bisnis (SENATIB) menyebabkan proses pencarian referensi berdasarkan topik penelitian menjadi kurang efisien apabila dilakukan secara manual. Penelitian ini bertujuan mengelompokkan artikel ilmiah berdasarkan kemiripan topik menggunakan pendekatan text mining dan algoritma K-Means Clustering. Data penelitian diperoleh melalui proses web scraping sebanyak 490 artikel yang terdiri atas atribut judul dan abstrak. Tahapan penelitian meliputi data cleaning, preprocessing (case folding, cleaning, tokenization, stopword removal), pembobotan menggunakan Term Frequency–Inverse Document Frequency (TF-IDF), penentuan jumlah cluster menggunakan Agglomerative Hierarchical Clustering dengan Ward Linkage dan Elbow Method, dilanjutkan proses clustering menggunakan K-Means. Hasil penelitian menunjukkan bahwa jumlah cluster yang paling representatif adalah tiga cluster. Evaluasi menggunakan Silhouette Score, Davies–Bouldin Index (DBI), dan Calinski–Harabasz Index (CHI) menghasilkan nilai masing-masing sebesar 0,0336, 4,5271, dan 13,7372. Meskipun tingkat pemisahan antarcluster masih relatif rendah akibat kemiripan topik antarartikel, hasil clustering mampu mengelompokkan artikel ke dalam tiga kelompok utama, yaitu Sistem Informasi, Internet of Things (IoT), dan Sistem Pendukung Keputusan. Penelitian ini diharapkan dapat membantu proses pencarian referensi berdasarkan topik serta memberikan gambaran mengenai persebaran topik penelitian pada prosiding SENATIB.

References

Dewi, L. P., Sukarno, P., & Nugroho, A. S. (2024). Evaluasi metrik clustering pada dokumen teks berbahasa Indonesia menggunakan Silhouette Score, DBI, dan CHI. Jurnal Teknologi Dan Sistem Komputer, 12(3), 118–127. https://doi.org/10.14710/jtsiskom.v12i3.4892

Hassan, B. A. (2024). From A-to-Z Review of Clustering Validation Indices. ArXiv.

Ikotun, A. M., Ezugwu, A. E., Abualigah, L., Abuhaija, B., & Heming, J. (2023). K-means clustering algorithms: A comprehensive review, variants analysis, and advances in the era of big data. Information Sciences, 622, 178–210. https://doi.org/10.1016/j.ins.2022.11.139

Ikotun, A. M., Habyarimana, F., & Ezugwu, A. E. (2025). Cluster validity indices for automatic clustering: A comprehensive review. Heliyon.

Mehta, V., Agarwal, M., & Kaliyar, R. (2024). A comprehensive and analytical review of text clustering techniques. International Journal of Data Science and Analytics. https://doi.org/10.1007/s41060-024-00540-x

Prasetya, D. A., & Sulistiani, H. (2023). Penerapan text mining untuk analisis kecenderungan topik penelitian pada prosiding ilmiah. Jurnal Sistem Dan Teknologi Informasi, 11(4), 312–321. https://doi.org/10.26418/justin.v11i4.64187

Rosyada, I. A., Utari, D. T., Rosyada, I. A., & Utari, D. T. (2024). Penerapan Principal Component Analysis untuk Reduksi Variabel pada Algoritma K-Means Clustering Penerapan Principal Component Analysis untuk Reduksi Variabel pada Algoritma K-Means Clustering. 5(1), 6–13.

Sembiring, R. K., & Hasibuan, J. S. (2023). Pengelompokan dokumen berbahasa Karo menggunakan TF-IDF dan K-Means Clustering. JURTEKSI, 9(3), 201–210. https://doi.org/10.33330/jurteksi.v9i3.2134

Surianto, D. A. (2025). Kombinasi TF-IDF dan Latent Dirichlet Allocation untuk peningkatan kualitas clustering artikel ilmiah. Jurnal Sistem Informasi Dan Teknologi, 7(1), 33–44. https://doi.org/10.37034/jsisfotek.v7i1.305

Wahyudi, A., & Nugroho, H. A. (2022). Implementasi TF-IDF untuk representasi fitur teks pada pengelompokan dokumen ilmiah. JATISI, 9(2), 756–768. https://doi.org/10.35957/jatisi.v9i2.2143

Wicaksono, A. F., Hidayat, R., & Sari, D. K. (2024). Document clustering menggunakan TF-IDF berbasis web scraping pada prosiding seminar nasional. JATISI, 11(2), 445–458. https://doi.org/10.35957/jatisi.v11i2.7218

Widaningrum, I., Rizqiana, U., & Rahmat, A. (2022). Pengelompokan dokumen penelitian menggunakan TF-IDF dan K-Means Clustering. Jurnal Ilmiah Teknologi Informasi, 12(2), 145–155. https://doi.org/10.28932/jiti.v12i2.5832

Downloads

Published

2026-07-24

How to Cite

Ningtias, N. W., Al Abllas, A. A., Kurniawan, A., Zakiya, N. H., & Arum, A. (2026). Model Hybrid Clustering untuk Artikel Ilmiah Prosiding SENATIB Berbasis TF-IDF . AI Dan SPK : Jurnal Artificial Intelligent Dan Sistem Penunjang Keputusan, 3(4), 445–453. Retrieved from https://jurnalmahasiswa.com/index.php/aidanspk/article/view/4377