ANALISIS PENGARUH JUMLAH POHON PADA KINERJA RANDOM FOREST DALAM KLASIFIKASI OBESITAS

Authors

  • Heri Akma Senjaya STMIK IKMI Cirebon, Indonesia
  • Rudi Kurniawan STMIK IKMI Cirebon, Indonesia
  • Bani Kurniawan STMIK IKMI Cirebon, Indonesia
  • Umi Hayati STMIK IKMI Cirebon, Indonesia

Keywords:

Random Forest, Klasifikasi Obesitas, Feature Importance

Abstract

Penelitian ini dilakukan untuk menganalisis dan mengoptimalkan performa algoritma random forest dalam mengklasifikasikan status obesitas berdasarkan data gaya hidup, antropometri, dan kebiasaan individu. Permasalahan utama yang melatarbelakangi penelitian ini adalah belum adanya nilai n_estimators yang optimal untuk menghasilkan akurasi terbaik pada klasifikasi multikelas, serta perlunya identifikasi fitur-fitur yang paling berkontribusi dalam menentukan hasil prediksi. Untuk memberikan solusi terhadap masalah tersebut, penelitian ini menerapkan pendekatan eksperimen komputasional dengan menguji beberapa variasi jumlah pohon keputusan, yaitu 10, 50, 100, 200, 300, dan 500. Proses penelitian dimulai dari pengumpulan dan pengolahan data melalui tahapan pre-processing, seperti normalisasi fitur numerik dan one-hot encoding untuk fitur kategorikal, kemudian dilanjutkan dengan pembagian data latih dan data uji, pelatihan model, serta evaluasi kinerja model. Evaluasi dilakukan menggunakan metrik akurasi, precision, recall, macro f1-score, dan confusion matrix untuk menilai tingkat keberhasilan klasifikasi pada setiap kategori obesitas. Analisis feature importance juga digunakan untuk mengetahui variabel-variabel yang memiliki pengaruh paling besar, seperti berat badan, tinggi badan, usia, kebiasaan makan, aktivitas fisik, serta konsumsi air harian. Hasil penelitian menunjukkan bahwa jumlah pohon yang digunakan sangat memengaruhi performa model, di mana nilai n_estimators 300 menghasilkan akurasi tertinggi sebesar 94%, sementara peningkatan hingga 500 pohon tidak memberikan peningkatan yang signifikan dan bahkan menunjukkan sedikit penurunan efektivitas. Selain itu, hasil analisis menunjukkan bahwa fitur berat badan, tinggi badan, dan usia merupakan faktor dominan yang menentukan klasifikasi obesitas. Temuan ini memperlihatkan pentingnya proses tuning parameter dalam meningkatkan kualitas prediksi dan efisiensi model pembelajaran mesin. Penelitian ini juga memiliki relevansi dengan pencapaian sustainable development goals (sdgs) khususnya pada tujuan ke-3 mengenai kesehatan dan kesejahteraan, karena dapat mendukung pengembangan sistem pendukung keputusan berbasis data untuk memantau risiko obesitas. Secara keseluruhan, penelitian ini memberikan kontribusi dalam menyediakan model klasifikasi obesitas yang akurat, efisien, dan informatif, serta memberikan wawasan mengenai fitur-fitur penting yang dapat dijadikan dasar dalam analisis kesehatan masyarakat.

References

X. Fu, Y. Chen, J. Yan, Y. Chen, and F. Xu, “BGRF: A Broad Granular Random Forest Algorithm,” Journal of Intelligent & Fuzzy Systems, vol. 44, no. 5, pp. 8103–8117, 2023, doi: 10.3233/jifs-223960.

A. Rojarath and W. Songpan, “Cost-Sensitive Probability for Weighted Voting in an Ensemble Model for Multi-Class Classification Problems,” Applied Intelligence, vol. 51, no. 7, pp. 4908–4932, 2021, doi: 10.1007/s10489-020-02106-3.

E. Carrizosa, J. Ramírez-Ayerbe, and D. R. Morales, “Generating Collective Counterfactual Explanations in Score-Based Classification via Mathematical Optimization,” Expert Systems With Applications, vol. 238, p. 121954, 2024, doi: 10.1016/j.eswa.2023.121954.

A. M. Agrawal, “Cardiovascular Disease Prediction Using Machine Learning,” International Journal of Artificial Intelligence, vol. 10, no. 2, pp. 59–68, 2023, doi: 10.36079/lamintang.ijai-01002.542.

V. Jain and K. L. Kashyap, “Multilayer Hybrid Ensemble Machine Learning Model for Analysis of Covid-19 Vaccine Sentiments,” Journal of Intelligent & Fuzzy Systems, vol. 43, no. 5, pp. 6307–6319, 2022, doi: 10.3233/jifs-220279.

N. Ramdani, S. S. Prasetyowati, and Y. Sibaroni, “Performance Analysis of Bandung City Traffic Flow Classification With Machine Learning and Kriging Interpolation,” Building of Informatics Technology and Science (Bits), vol. 4, no. 2, pp. 694–704, 2022, doi: 10.47065/bits.v4i2.1972.

N. Sulistiyono, C. P. Tarigan, A. F. Daulay, S. A. Hudjimartsu, and Y. U. Putri, “Identification of Mangrove Forests Using Sentinel-1 Synthetic Aperture Radar (SAR) Satellite Imagery in Medan Belawan District, Medan City,” Iop Conference Series Earth and Environmental Science, vol. 1352, no. 1, p. 12051, 2024, doi: 10.1088/1755-1315/1352/1/012051.

G. Shi et al., “A Random Forest Algorithm-Based Prediction Model for Moderate to Severe Acute Postoperative Pain After Orthopedic Surgery Under General Anesthesia,” BMC Anesthesiology, vol. 23, no. 1, 2023, doi: 10.1186/s12871-023-02328-1.

A. Maulana, R. P. F. Afidh, N. B. Maulydia, G. M. Idroes, and S. Rahimah, “Predicting Obesity Levels With High Accuracy: Insights From a CatBoost Machine Learning Model,” Infolitika J. Data Sci., vol. 2, no. 1, pp. 17–27, 2024, doi: 10.60084/ijds.v2i1.195.

B. Allen, “An Interpretable Machine Learning Model of Cross-Sectional U.S. County-Level Obesity Prevalence Using Explainable Artificial Intelligence,” Plos One, vol. 18, no. 10, p. e0292341, 2023, doi: 10.1371/journal.pone.0292341.

H. Wu, T. Yang, H. Wu, H. Li, and Z. Zhou, “Air Quality Prediction Based on Long Short-Term Memory Model With Advanced Feature Selection and Hyperparameter Optimization,” Journal of Intelligent & Fuzzy Systems, vol. 45, no. 4, pp. 5971–5985, 2023, doi: 10.3233/jifs-232308.

C. García-Pérez, L. J. Herrera, J. C. Fernández, and M. Lozano, “Feature selection and classification of obesity levels based on supervised learning techniques,” Expert Systems with Applications, vol. 195, p. 116606, 2022.

Downloads

Published

16-07-2026

Citation Check