Analisis Perbandingan Kinerja Metode K-Nearest Neighbors dan Regresi Logistik Biner dalam Klasifikasi Risiko Penyakit Jantung Berdasarkan Faktor Klinis
Keywords:
classification, heart disease, K-Nearest Neighbors, binary logistic regressionAbstract
Penyakit jantung merupakan salah satu penyebab kematian tertinggi di dunia, sehingga diperlukan metode klasifikasi yang akurat untuk mendukung deteksi dini risiko penyakit. Meskipun metode K-Nearest Neighbors (KNN) dan Regresi Logistik Biner telah banyak digunakan, perbandingan kedua metode dengan prosedur preprocessing dan threshold tuning yang konsisten masih terbatas. Penelitian ini bertujuan membandingkan kinerja metode KNN dan Regresi Logistik Biner menggunakan Heart Disease Dataset dari UCI Machine Learning Repository yang terdiri atas 270 observasi dan 13 peubah prediktor. Analisis dilakukan melalui pre-processing data, penanganan outlier menggunakan metode IQR, normalisasi Min-Max pada KNN, serta penentuan threshold optimal menggunakan Youden’s J Index dan evaluasi model menggunakan akurasi, presisi, sensitivitas, spesifisitas, F1-score, dan AUC. Hasil penelitian menunjukkan bahwa KNN dengan memberikan performa terbaik secara umum, dengan akurasi 0.83, spesifisitas 0.91, presisi 0.87, F1-score 0.79, dan AUC 0.86. Sementara itu, Regresi Logistik Biner menghasilkan akurasi 0.78 dan AUC 0.82, tetapi memiliki sensitivitas yang lebih tinggi, yaitu 0.75 dibandingkan KNN sebesar 0.72. Secara keseluruhan, KNN unggul pada sebagian besar metrik evaluasi, sedangkan Regresi Logistik Biner lebih sesuai ketika prioritas utama adalah meminimalkan kasus pasien sakit yang tidak terdeteksi.
