Model Hybrid Clustering untuk Artikel Ilmiah Prosiding SENATIB Berbasis TF-IDF
Keywords:
text mining, TF-IDF, K-Means Clustering, Agglomerative Hierarchical Clustering, SENATIBAbstract
Meningkatnya jumlah artikel ilmiah pada prosiding Seminar Nasional Teknologi Informasi dan Bisnis (SENATIB) menyebabkan proses pencarian referensi berdasarkan topik penelitian menjadi kurang efisien apabila dilakukan secara manual. Penelitian ini bertujuan mengelompokkan artikel ilmiah berdasarkan kemiripan topik menggunakan pendekatan text mining dan algoritma K-Means Clustering. Data penelitian diperoleh melalui proses web scraping sebanyak 490 artikel yang terdiri atas atribut judul dan abstrak. Tahapan penelitian meliputi data cleaning, preprocessing (case folding, cleaning, tokenization, stopword removal), pembobotan menggunakan Term Frequency–Inverse Document Frequency (TF-IDF), penentuan jumlah cluster menggunakan Agglomerative Hierarchical Clustering dengan Ward Linkage dan Elbow Method, dilanjutkan proses clustering menggunakan K-Means. Hasil penelitian menunjukkan bahwa jumlah cluster yang paling representatif adalah tiga cluster. Evaluasi menggunakan Silhouette Score, Davies–Bouldin Index (DBI), dan Calinski–Harabasz Index (CHI) menghasilkan nilai masing-masing sebesar 0,0336, 4,5271, dan 13,7372. Meskipun tingkat pemisahan antarcluster masih relatif rendah akibat kemiripan topik antarartikel, hasil clustering mampu mengelompokkan artikel ke dalam tiga kelompok utama, yaitu Sistem Informasi, Internet of Things (IoT), dan Sistem Pendukung Keputusan. Penelitian ini diharapkan dapat membantu proses pencarian referensi berdasarkan topik serta memberikan gambaran mengenai persebaran topik penelitian pada prosiding SENATIB.
References
Dewi, L. P., Sukarno, P., & Nugroho, A. S. (2024). Evaluasi metrik clustering pada dokumen teks berbahasa Indonesia menggunakan Silhouette Score, DBI, dan CHI. Jurnal Teknologi Dan Sistem Komputer, 12(3), 118–127. https://doi.org/10.14710/jtsiskom.v12i3.4892
Hassan, B. A. (2024). From A-to-Z Review of Clustering Validation Indices. ArXiv.
Ikotun, A. M., Ezugwu, A. E., Abualigah, L., Abuhaija, B., & Heming, J. (2023). K-means clustering algorithms: A comprehensive review, variants analysis, and advances in the era of big data. Information Sciences, 622, 178–210. https://doi.org/10.1016/j.ins.2022.11.139
Ikotun, A. M., Habyarimana, F., & Ezugwu, A. E. (2025). Cluster validity indices for automatic clustering: A comprehensive review. Heliyon.
Mehta, V., Agarwal, M., & Kaliyar, R. (2024). A comprehensive and analytical review of text clustering techniques. International Journal of Data Science and Analytics. https://doi.org/10.1007/s41060-024-00540-x
Prasetya, D. A., & Sulistiani, H. (2023). Penerapan text mining untuk analisis kecenderungan topik penelitian pada prosiding ilmiah. Jurnal Sistem Dan Teknologi Informasi, 11(4), 312–321. https://doi.org/10.26418/justin.v11i4.64187
Rosyada, I. A., Utari, D. T., Rosyada, I. A., & Utari, D. T. (2024). Penerapan Principal Component Analysis untuk Reduksi Variabel pada Algoritma K-Means Clustering Penerapan Principal Component Analysis untuk Reduksi Variabel pada Algoritma K-Means Clustering. 5(1), 6–13.
Sembiring, R. K., & Hasibuan, J. S. (2023). Pengelompokan dokumen berbahasa Karo menggunakan TF-IDF dan K-Means Clustering. JURTEKSI, 9(3), 201–210. https://doi.org/10.33330/jurteksi.v9i3.2134
Surianto, D. A. (2025). Kombinasi TF-IDF dan Latent Dirichlet Allocation untuk peningkatan kualitas clustering artikel ilmiah. Jurnal Sistem Informasi Dan Teknologi, 7(1), 33–44. https://doi.org/10.37034/jsisfotek.v7i1.305
Wahyudi, A., & Nugroho, H. A. (2022). Implementasi TF-IDF untuk representasi fitur teks pada pengelompokan dokumen ilmiah. JATISI, 9(2), 756–768. https://doi.org/10.35957/jatisi.v9i2.2143
Wicaksono, A. F., Hidayat, R., & Sari, D. K. (2024). Document clustering menggunakan TF-IDF berbasis web scraping pada prosiding seminar nasional. JATISI, 11(2), 445–458. https://doi.org/10.35957/jatisi.v11i2.7218
Widaningrum, I., Rizqiana, U., & Rahmat, A. (2022). Pengelompokan dokumen penelitian menggunakan TF-IDF dan K-Means Clustering. Jurnal Ilmiah Teknologi Informasi, 12(2), 145–155. https://doi.org/10.28932/jiti.v12i2.5832




