Klasifikasi Emosi Data Text Bahasa Indonesia Menggunakan Algoritma BERT, RoBERTa, dan DistilBERT
Abstract
Analisis sentimen memiliki beberapa peran penting untuk berbagai macam tujuan. 2 hasil
yang didapat dalam analisis sentimen seperti positif dan negatif masih memiliki keterbatasan
dalam memahami makna emosional kalimat dalam bentuk text digital, berbeda dengan
klasifikasi emosi data text. Klasifikasi emosi data text memiliki kelebihan dalam memahami
makna emosional kalimat dalam bentuk text digital dengan berbagai macam makna
emosional. Data text yang digunakan dalam klasifikasi emosi data text kebanyakan
menggunakan data text Bahasa Inggris dan pengembangan penelitian tentang klasifikasi
emosi data text Bahasa Indonesia masih berjalan lambat. Berjalan lambatnya penelitian
klasifikasi emosi data text Bahasa Indonesia mengharapkan peneliti untuk membangun
klasifikasi emosi data text Bahasa Indonesia menggunakan 3 model yang mumpuni : BERT,
RoBERTa, DistilBERT untuk mengetahui kualitas masing-masing model dalam nilai
ukuran, waktu dalam melakukan training, akurasi, dan f1-score dengan menggunakan proses
fine-tuning : penambahan output layer dan loss function dan hyperparameter-tuning. Data
text yang digunakan adalah indo4B dan mengolah dengan cara undersample. Penelitian ini
menghasilkan model yang dapat menerapkan klasifikasi emosi dengan hasil yang baik.
Skenario yang telah diterapkan pada penelitian ini menghasilkan model BERT mendapatkan
nilai parameter = 109486085, waktu training = 24 min 00 s, akurasi = 89,60, dan nilai f1-
score = 90. Model RoBERTa mendapatkan nilai parameter = 124649477, waktu training =
25 min 39 s, akurasi = 90,83, dan nilai f1-score = 91. Model DistilBERT mendapatkan nilai
parameter = 66366725, waktu training = 13 min 34 s, akurasi = 88,99, dan nilai f1-score =
89.
Collections
- Master of Informatics [380]
