PENINGKATAN KINERJA ALGORITMA NAIVE BAYES DAN SUPPORT VECTOR MACHINE DENGAN SAMPLING HIBRIDA UNTUK MENANGANI KETIDAKSEIMBANGAN SENTIMEN ULASAN STEAM

Authors

  • Dimas Eka Syahputra STMIK IKMI Cirebon, Indonesia
  • Rudi Kurniawan STMIK IKMI Cirebon, Indonesia
  • Bani Nurhakim STMIK IKMI Cirebon, Indonesia
  • Aris Pratama Putra STMIK IKMI Cirebon, Indonesia

Keywords:

analisis sentimen, Naive Bayes, Support Vector Machine, SMOTE, SMOTE-ENN, ketidakseimbangan data, ulasan Steam

Abstract

Ketidakseimbangan kelas pada data ulasan pengguna sering menyebabkan model analisis sentimen mengabaikan kelas minoritas sehingga keputusan yang dihasilkan menjadi kurang adil dan kurang dapat diandalkan. Penelitian ini bertujuan menganalisis serta meningkatkan kinerja algoritma Naive Bayes dan Support Vector Machine (SVM) dalam mengklasifikasikan ketidakseimbangan sentimen ulasan Steam melalui penerapan teknik penyeimbangan data. Dataset sekunder Steam Reviews dari Kaggle diproses melalui tahapan pembersihan teks, normalisasi, tokenisasi, penghapusan stopword, dan stemming, kemudian direpresentasikan menggunakan Term Frequency–Inverse Document Frequency (TF-IDF). Eksperimen dilakukan pada tiga skenario, yaitu baseline tanpa sampling, resampling tunggal dengan Synthetic Minority Over-sampling Technique (SMOTE), dan sampling hibrida dengan SMOTE-Edited Nearest Neighbour (SMOTE-ENN). Kinerja model dievaluasi menggunakan metrik akurasi, precision, recall, dan F1-score untuk menilai keseimbangan performa pada tiap kelas. Hasil penelitian menunjukkan bahwa ketidakseimbangan kelas menurunkan recall dan F1-score kelas negatif pada kedua model. Penerapan SMOTE pada Naive Bayes mampu mempertahankan akurasi sekitar 79 persen sekaligus meningkatkan recall kelas negatif menjadi 0,84 dan F1-score menjadi 0,80 sehingga menghasilkan trade-off terbaik antar metrik. Sebaliknya, penggunaan SMOTE-ENN cenderung mengubah distribusi data secara berlebihan sehingga menurunkan akurasi dan F1-score meskipun recall kelas minoritas meningkat. Berdasarkan temuan tersebut, dapat disimpulkan bahwa kombinasi Naive Bayes dan SMOTE merupakan pendekatan yang paling efektif untuk menangani ketidakseimbangan data sentimen ulasan Steam serta dapat dijadikan rujukan praktis bagi pengembangan sistem analisis sentimen pada platform digital serupa. Novelty penelitian ini terletak pada fokus evaluasi sistematis pengaruh berbagai skenario resampling terhadap performa model teks, khususnya pada dataset sentimen ulasan game digital berbahasa Inggris dari platform Steam yang populer secara global. 

References

M. Mujahid, E. Kina, F. Rustam, E. Silva Alvarado, I. De La Torre Diez, and I. Ashraf, “Data oversampling and imbalanced datasets: An investigation of performance for machine learning and feature engineering,” J. Big Data, vol. 11, no. Article 87, 2024, doi: 10.1186/s40537-024-00943-4.

Z. Sun, J. Zhang, X. Zhu, and D. Xu, “How far have we progressed in the sampling methods for imbalanced data classification? An empirical study,” Electronics (Basel)., vol. 12, no. 20, 2023, doi: 10.3390/electronics12204232.

C. Suhaeni and H.-S. Yong, “Enhancing imbalanced sentiment analysis: A GPT-3-based sentence-by-sentence generation approach,” Applied Sciences, vol. 14, no. 2, 2024, doi: 10.3390/app14020622.

W. Chen, K. Yang, Z. Yu, Y. Shi, and C. L. P. Chen, “A survey on imbalanced learning: Latest research, applications and future directions,” Artif. Intell. Rev., vol. 57, 2024, doi: 10.1007/s10462-024-10759-6.

G. Aguiar, A. Bifet, J. Read, J. Gama, and M. Pechenizkiy, “A survey on learning from imbalanced data streams: Taxonomy, challenges, empirical study, and reproducible experimental framework,” Mach. Learn., 2024, doi: 10.1007/s10994-023-06353-6.

M. Salmi, D. Atif, D. Oliva, A. Abraham, S. Ventura, and et al., “Handling imbalanced medical datasets: Review of a decade of research,” Artif. Intell. Rev., vol. 57, 2024, doi: 10.1007/s10462-024-10884-2.

M. Zheng et al., “Exploratory parallel hybrid sampling framework for imbalanced data classification,” Eng. Appl. Artif. Intell., vol. 138, p. 109428, Dec. 2024, doi: 10.1016/j.engappai.2024.109428.

B. Zhu, X. Pan, S. vanden Broucke, and J. Xiao, “A GAN-based hybrid sampling method for imbalanced customer classification,” Inf. Sci. (N. Y)., vol. 609, pp. 1397–1411, Sep. 2022, doi: 10.1016/j.ins.2022.07.145.

Downloads

Published

01-07-2026

Citation Check