Penulis: Reza Ishak Estiko ; Bambang Widyantoro ; Dafsah Arifa Juzar ; Ramdhan Maulana Yusup ; Iqbal Fauzi Rakhmat ; Estiko Rijanto
Abstrak:
Tujuan: Studi ini bertujuan untuk melakukan skrining hipertensi pada populasi Indonesia yang luas dengan menggunakan pembelajaran mesin (machine learning/ML) dan 11 faktor risiko non-laboratorium, serta memvalidasi hasilnya melalui validasi internal dan eksternal.
Latar belakang dan peserta: Dari 1.782.365 peserta awal berusia 15 tahun ke atas yang terdaftar di Pos Pembinaan Terpadu (Posbindu) pusat pelayanan kesehatan primer di seluruh Indonesia pada periode 2014 hingga 2017, data yang tidak lengkap dan pencilan (outliers) dikeluarkan. Sebanyak 268.210 peserta dimasukkan dalam analisis kami. Kumpulan data (dataset) dibagi secara deterministik menjadi satu dataset untuk pelatihan menggunakan validasi silang internal 10-lipat pada 204.315 peserta dan dataset lainnya untuk validasi eksternal pada 63.895 peserta.
Desain: Studi potong lintang retrospektif ini menggunakan tiga algoritma pembelajaran mesin, yaitu random forest, gradient boosting, dan extreme gradient boosting (XGBoost), serta membandingkannya dengan regresi logistik sebagai tolok ukur (benchmark) untuk skrining hipertensi berdasarkan kriteria WHO dan International Society of Hypertension. Tingkat kepentingan (importance) faktor risiko diurutkan. Dengan sebagian menggunakan variabel kontinu versus kategorikal untuk usia, lingkar pinggang (waist circumference/WC), dan indeks massa tubuh (body mass index/BMI), kami mengevaluasi kinerja skrining terkait sensitivitas dan area di bawah kurva karakteristik operasi penerima (area under the receiver operating characteristic curve/AUC).
Hasil: Validasi eksternal mengungkapkan bahwa model XGBoost memberikan kinerja terbaik dalam skrining hipertensi. Validasi eksternal yang sebagian menggunakan variabel kontinu memberikan sensitivitas 0,97 dan AUC 0,75, yang mengindikasikan kemampuan skrining yang sangat baik. Peringkat kepentingan faktor risiko secara berurutan adalah riwayat keluarga hipertensi (family history of hypertension/FH-HTN), usia, WC, BMI, pekerjaan, pendidikan, jenis kelamin, merokok, aktivitas fisik rendah, kurang asupan buah atau sayuran, dan konsumsi alkohol.
Kesimpulan: Dengan menggunakan 11 faktor risiko non-laboratorium yang mudah dikumpulkan, model pembelajaran mesin berhasil melakukan skrining hipertensi dengan kinerja yang lebih baik daripada tolok ukur. Penggunaan variabel numerik untuk usia, WC, dan BMI menghasilkan kemampuan diskriminasi yang lebih baik dibandingkan variabel kategorikal. FH-HTN dan usia merupakan dua faktor risiko utama terjadinya hipertensi. Studi ini merupakan latihan akademis yang bermanfaat dan menunjukkan pentingnya pembelajaran mesin dalam menangani kumpulan data berskala besar.
Artikel ini dapat diakses di https://bmjopen.bmj.com/content/15/8/e092364
