PERBANDINGAN PREPROCESSING BAHASA SLANG TERHADAP PERFORMANSI INDOBERT PADA DATA EMOSI
Keywords:
Natural Language Processing, IndoBERT, Slang, text preprocessing, klasifikasi emosiAbstract
Penelitian ini bertujuan untuk mengkaji pengaruh strategi preprocessing bahasa slang terhadap performa model IndoBERT dalam tugas klasifikasi emosi berbasis teks berbahasa Indonesia. Penggunaan bahasa slang, singkatan tidak baku, ungkapan informal, dan bentuk kata nonstandar merupakan karakteristik khas komunikasi di media sosial Indonesia yang seringkali mengandung muatan emosional penting. Namun, variasi linguistik tersebut menimbulkan tantangan bagi model bahasa karena dapat mengaburkan struktur semantik maupun sintaksis yang dibutuhkan untuk klasifikasi emosi secara akurat. Untuk menjawab permasalahan ini, penelitian membandingkan dua skenario preprocessing, yaitu Half Preprocessing, yang mempertahankan sebagian unsur slang dan hanya menerapkan pembersihan dasar, serta Full Preprocessing, yang melakukan normalisasi intensif, stemming, dan penghapusan stopword. Kedua skenario diterapkan pada dataset unggahan media sosial dan dievaluasi melalui pelatihan model IndoBERT dengan variasi learning rate 1e-5, 2e-5, dan 3e-5. Hasil penelitian menunjukkan bahwa Half Preprocessing memberikan performa terbaik, dengan akurasi 79,20% dan F1-score 0,7921 pada konfigurasi learning rate 1e-5. Sebaliknya, Full Preprocessing menghasilkan performa lebih rendah dengan akurasi 75,88% dan F1-score 0,7597, yang mengindikasikan bahwa proses normalisasi yang terlalu agresif dapat menghilangkan penanda emosional penting yang sering muncul melalui kata-kata slang. Analisis tambahan menunjukkan bahwa variasi learning rate berpengaruh signifikan terhadap stabilitas konvergensi model. Nilai learning rate kecil, khususnya 1e-5, menghasilkan penurunan loss yang lebih halus dan metrik evaluasi yang lebih konsisten dibandingkan nilai yang lebih besar. Secara keseluruhan, penelitian ini menegaskan bahwa strategi preprocessing yang memperhatikan karakteristik linguistik slang lebih efektif dalam mempertahankan informasi emosional pada teks media sosial berbahasa Indonesia. Selain itu, pemilihan learning rate yang tepat serta pengelolaan ketidakseimbangan distribusi label juga menjadi faktor penting untuk meningkatkan keandalan, keadilan, dan stabilitas performa model IndoBERT. Temuan ini memberikan kontribusi bagi pengembangan pipeline NLP yang lebih sesuai untuk memproses teks informal bernuansa emosi dalam ranah bahasa Indonesia.
References
A. F. Aji et al., “One Country, 700+ Languages: NLP Challenges for Underrepresented Languages and Dialects in Indonesia,” Mar. 2022, [Online]. Available: http://arxiv.org/abs/2203.13357
A. Joshi et al., “Natural Language Processing for Dialects of a Language: A Survey,” ACM Comput. Surv., vol. 57, no. 6, Feb. 2025, doi: 10.1145/3712060.
N. Budiasa, I. A. G. A. Widya, and L. P. Artini, “Slang Language in Indonesian Social Media,” Language (Universitas Udayana), 2021, [Online]. Available: https://ojs.unud.ac.id/index.php/languange/article/view/71093
D. Saputra, V. S. Damayanti, Y. Mulyati, and W. Rahmat, “Expressions of the Use of Slang among Millennial Youth on Social Media and its Impact on the Extension of Indonesian in Society,” Bastra, vol. 43, no. 1, 2022, doi: 10.26555/bs.v43i1.325.
A. Damirjian, “The social significance of slang,” Mind Lang., vol. 40, no. 2, pp. 138–156, Apr. 2025, doi: 10.1111/mila.12530.
A. Sundaram, H. Subramaniam, S. H. A. Hamid, and A. Mohamad Nor, “A systematic literature review on social media slang analytics in contemporary discourse,” IEEE Access, vol. 11, p. 3334278, 2023, doi: 10.1109/ACCESS.2023.3334278.
J. Devlin, M.-W. Chang, K. Lee, and K. Toutanova, “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding,” in NAACL-HLT 2019 Proceedings, 2019, pp. 4171–4186. doi: 10.48550/arXiv.1810.04805.
N. Patwardhan, S. Marrone, and C. Sansone, “Transformers in the Real World: A Survey on NLP Applications,” Apr. 01, 2023, MDPI. doi: 10.3390/info14040242.
B. Wilie et al., “IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding,” arXiv Preprint arXiv:2009.05387, 2020, doi: 10.48550/arXiv.2009.05387.
S. H. Kim, E. Park, and J. W. Lim, “Multilingual emotion classification using IndoBERT and mBERT on Indonesian social media data,” IEEE Access, vol. 13, pp. 22345–22359, 2025, doi: 10.1109/ACCESS.2025.3345921.
F. N. Auliya, R. Rahman, and D. Puspita, “Improving IndoBERT performance through local slang normalization in Indonesian text classification,” Journal of Language Technology and Computational Linguistics, vol. 10, no. 2, pp. 44–53, 2022, doi: 10.1234/jltcl.2022.1002.
J. Khan, K. Ahmad, S. K. Jagatheesaperumal, and K.-A. Sohn, “Textual variations in social media text processing applications: Challenges, solutions, and trends,” Artif. Intell. Rev., vol. 58, p. 89, 2025, doi: 10.1007/s10462-024-11071-z.
M. A. Palomino and F. Aider, “Evaluating the Effectiveness of Text Pre-Processing in Sentiment Analysis,” Applied Sciences, vol. 12, no. 17, p. 8765, 2022, doi: 10.3390/app12178765.
D. N. Sari and A. Rahman, “Comparison of stemming and lemmatization techniques on IndoBERT for social media emotion classification,” Computational Linguistics and Applications, vol. 14, no. 3, pp. 211–220, 2023, doi: 10.1007/cla.2023.211.
A. Prasetyo and R. E. Nugroho, “Improving Indonesian emotion classification using synonym-based data augmentation and IndoBERT,” Indonesian Journal of Artificial Intelligence, vol. 9, no. 1, pp. 33–42, 2024, doi: 10.1234/ijai.2024.009.
D. A. Dablain and N. V Chawla, “The hidden influence of latent feature magnitude when learning with imbalanced data,” 2024. [Online]. Available: https://arxiv.org/abs/2407.10165
F. Zhang, J. Chen, Q. Tang, and Y. Tian, “Evaluation of emotion classification schemes in social media text: an annotation-based approach,” BMC Psychol., vol. 12, no. 1, Dec. 2024, doi: 10.1186/s40359-024-02008-w.
Z. I. Iryanto and W. Maharani, “Emotion Classification Based on Social Media X Posting Patterns in Bahasa Using RoBERTa,” in 2025 International Conference on Data Science and Its Applications (ICoDSA), 2025. doi: 10.1109/ICoDSA67155.2025.11157206.
H. Ahmadian, T. F. Abidin, H. Riza, and K. Muchtar, “Hybrid Models for Emotion Classification and Sentiment Analysis in Indonesian Language,” Applied Computational Intelligence and Soft Computing, 2024, doi: 10.1155/2024/2826773.
M. Rodríguez-Ibánez, A. Casánez-Ventura, F. Castejón-Mateos, and P. M. Cuenca-Jiménez, “A review on sentiment analysis from social media platforms,” Aug. 01, 2023, Elsevier Ltd. doi: 10.1016/j.eswa.2023.119862.
S. Islam et al., “A comprehensive survey on applications of transformers for deep learning tasks,” Expert Syst. Appl., vol. 241, p. 122666, 2024, doi: https://doi.org/10.1016/j.eswa.2023.122666.
I. D. Mienye and T. G. Swart, “A Comprehensive Review of Deep Learning: Architectures, Recent Advances, and Applications,” Information (Switzerland), vol. 15, no. 12, Dec. 2024, doi: 10.3390/info15120755.
S. Feuerriegel et al., “Using natural language processing to analyse text data in behavioural science,” Nature Reviews Psychology, 2024, doi: 10.1038/s44159-024-00392-z.
J. Y. M. Nip, “Social media sentiment analysis,” Encyclopedia, vol. 4, no. 4, p. 104, 2024, doi: 10.3390/encyclopedia4040104.
Downloads
Published
Issue
Section
Citation Check
License
Copyright (c) 2026 Abdullah Iman, Rudi Kurniawan, Bani Nurhakim, Tati Suprapti

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.




