Tag: IndoBERT Base

  • Model BERT untuk Mendeteksi Hoax Provokatif

    Model BERT untuk Mendeteksi Hoax Provokatif

    Penulis: Rio Yunanto, Eri Prasetyo Wibowo, Rianto R

    Abstrak

    Banjir informasi membuat pengguna media sosial rentan menjadi korban hoax provokatif atau bahkan menyebarkan hoax sendiri. Penelitian ini menguji kemampuan dua varian model Bidirectional Encoder Representations from Transformers (BERT) untuk bahasa Indonesia (IndoBERT Base Model dan Indonesian BERT base model 522M) dalam mengembangkan deteksi hoax provokatif dalam bahasa Indonesia. Metode yang diusulkan menggunakan dua varian model BERT monolingual untuk bahasa Indonesia dari pustaka Huggingface. Alur arsitektur metode yang diusulkan dimulai dengan pengumpulan dan pelabelan data dari situs web pengumpul hoax komunitas, diikuti oleh pra-pemrosesan. Data yang telah dibersihkan kemudian dibagi menjadi data pelatihan dan pengujian untuk melanjutkan ke tahap fine-tuning, di mana beberapa lapisan dan bobot model BERT disesuaikan agar sesuai dengan tugas klasifikasi yang diinginkan. Hasil eksperimen penelitian menunjukkan bahwa varian BERT Indonesia yang direkomendasikan untuk deteksi hoaks provokatif adalah IndoBERT Base Model dengan learning rate 1e-5, ukuran batch 32, dan batas panjang maksimum 128 token, mencapai akurasi pelatihan rata-rata 99,22%, dengan waktu pelatihan 21 menit 52 detik. Temuan penelitian juga menunjukkan bahwa learning rate 1e-5 dapat menghasilkan akurasi pengujian yang lebih baik daripada learning rate 2e-5 atau 3e-5. Model deteksi hoaks provokatif menggunakan varian BERT Indonesia perlu ditingkatkan, terutama dalam hal pengumpulan data hoaks dalam jumlah besar, untuk meningkatkan akurasi model deteksi hoaks provokatif. © School of Engineering, Taylor’s University.

    Kata kunci penulis

    Akurasi; Klasifikasi; Hoaks; Provokatif; Transformer

    Artikel ini dapat diakses di https://www.scopus.com/pages/publications/85180943734