Optimasi K-NN Menggunakan SMOTE dan Cosine Similarity pada Klasifikasi Topik Skripsi
Keywords:
Imbalanced Data, Judul Skripsi, Bidang Dosen, Klasifikasi Teks, K-NNAbstract
Penentuan dosen pembimbing skripsi yang linear dengan topik penelitian mahasiswa merupakan tahapan krusial dalam penyelesaian tugas akhir. Pemetaan judul ke bidang keahlian dosen secara manual seringkali kurang efisien dan dihadapkan pada tantangan distribusi topik yang tidak merata (imbalanced data). Penelitian ini mengusulkan optimasi model klasifikasi berbasis algoritma K-Nearest Neighbor (K-NN) menggunakan 1.598 data historis judul skripsi dari Universitas AMIKOM Yogyakarta. Untuk mengatasi ketimpangan jumlah sampel antar bidang dosen, teknik Synthetic Minority Over-sampling Technique (SMOTE) diimplementasikan pada fase pelatihan data (data train). Proses ekstraksi Informasi teks melalui tahapan preprocessing komprehensif, meliputi case folding, stopword removal, dan stemming, yang kemudian dibobotkan menggunakan Term Frequency-Inverse Document Frequency (TF-IDF). Pembagian komposisi data latih dan uji ditetapkan sebesar 80:20. Berbeda dengan pendekatan spasial standar, model ini diuji menggunakan metrik jarak Cosine Similarity untuk mengukur kedekatan semantik antar dokumen dengan lebih presisi. Hasil eksperimen menunjukkan bahwa klasifikasi K-NN mencapai performa maksimal pada parameter k=21 dengan tingkat akurasi sebesar 85.94%. Integrasi SMOTE dan metrik Cosine terbukti secara signifikasn menaikkan sensitivitas model, ditandai dengan nilai recall hingga 95% pada pengenalan kategori bidang dosen minoritas yang sebelumnya sulit diklasifikasikan.
References
Al Tawil, A., Almazaydeh, L., Qawasmeh, D. S., Qawasmeh, B., Alshinwan, M., & Elleithy, K. (2024). Comparative Analysis of Machine Learning Algorithms for Email Phishing Detection Using TF-IDF, Word2Vec, and BERT. Comput. Mater. Continua, 81(2), 3395–3412.
Ankisqiantari, N. (2025). Penanganan Imbalance Data Klasifikasi Teks Lowongan Pekerjaan : Komparasi Algorithmic vs Data Level. 14(2), 73–84.
Duhita, W. M. P., Darmawan, M. F. K., Triana, L., & Ankisqiantari, N. (2022). Perbandingan Algoritma Supervised Learning untuk Klasifikasi Judul Skripsi Berdasarkan Bidang Dosen Comparison of Supervised Learning Algorithm for Classification of Thesis Titles Based on Lecturer. 8, 427–437.
Fern ́andez, A., Garc ́ıa, S., Herrera, F., & Chawla, N. V. (2018). SMOTE for Learning from Imbalanced Data_ Progress and Challenges, Marking the 15-year Anniversary.pdf (pp. 863--905).
Gunawan, D., Sembiring, C. A., & Budiman, M. A. (2018). The Implementation of Cosine Similarity to Calculate Text Relevance between Two Documents. Journal of Physics: Conference Series, 978, 012120.
Idwan, S., Etaiwi, W., Rafayia, H., & Matar, I. (2025). A comprehensive review of statistical variants and enhancements of SMOTE oversampling method. International Journal of Data Science and Analytics, 20(8), 6887–6904.
Isnain, A. R., Supriyanto, J., & Kharisma, M. P. (2021). Implementation of K-Nearest Neighbor (K-NN) algorithm for public sentiment analysis of online learning. IJCCS (Indonesian Journal of Computing and Cybernetics Systems), 15(2), 121–130.
Kowsari, K., Meimandi, K. J., Heidarysafa, M., Mendu, S., Barnes, L., & Brown, D. (2019). Text Classification Algorithms : A Survey. 1–68. https://doi.org/10.3390/info10040150
Qaiser, Shahzad, & Ali, R. (2018). Text Mining: Use of TF-IDF to Examine the Relevance of Words to Documents. International Journal of Computer Applications, 181, 25–29. https://doi.org/10.5120/ijca2018917395
Safar, N. Z. M., Mujilahwati, S., Halif, K. M. N. K., & Ghazalli, N. (2024). Optimizing sentiment analysis of Indonesian texts: Enhancing deep learning models with genetic algorithm-based feature selection. Journal of Soft Computing and Data Mining, 5(2), 208–222.
Saputra, N. A., Aeni, K., & Saraswati, N. M. (2024). Indonesian Hate Speech Text Classification Using Improved K-Nearest Neighbor with TF-IDF-ICS$ρ$F. Vol, 11, 21–30.
Thabtah, F., Hammoud, S., Kamalov, F., & Gonsalves, A. (2020). Data imbalance in classification : Experimental evaluation. 513, 429–441. https://doi.org/10.1016/j.ins.2019.11.004
Yusupov, K., Islam, M. R., Muminov, I., Sahlabadi, M., & Yim, K. (2024). Comparative analysis of machine learning and deep learning models for email spam classification using TF-IDF and word embedding techniques. International Conference on Broadband and Wireless Computing, Communication and Applications, 114–122.




