Perbandingan Pelabelan Sentimen Berbantuan Generative AI
Abstract
Analisis sentimen terhadap respons mahasiswa merupakan pendekatan yang dapat
digunakan untuk mengevaluasi efektivitas platform pembelajaran digital. Namun, proses
analisis secara manual menjadi tidak praktis seiring bertambahnya volume data, sehingga
diperlukan pendekatan komputasional yang lebih efisien. Penelitian ini bertujuan untuk
membandingkan performa model Generative AI dalam melakukan pelabelan sentimen
terhadap respons mahasiswa mengenai penggunaan Google Classroom. Penelitian ini menguji
tiga model Large Language Model (LLM) secara zero-shot, yaitu GPT-4.1, GPT-4o, dan
Claude Haiku 4.5, serta satu model berbasis fine-tuning, yaitu IndoBERT. Eksperimen
dilakukan pada dua kondisi dataset, yaitu raw dan preprocessed, dengan masing-masing model
dijalankan sebanyak tiga kali dan performanya dihitung sebagai nilai rata-rata dari ketiga run
beserta standar deviasi sebagai indikator konsistensi. Evaluasi performa dilakukan
menggunakan metrik accuracy dan macro average F1-score. Hasil penelitian menunjukkan
Claude Haiku 4.5 mencatatkan performa terbaik dengan akurasi 85,59% dan macro F1-score
0,79 pada data preprocessed. GPT-4o dan GPT-4.1 juga menunjukkan hasil yang baik, masing-
masing dengan akurasi terbaik 80,00% dan 78,92%. IndoBERT mencatatkan performa
terendah dengan akurasi 76,22% dan macro F1-score 0,68 yang stagnan pada kedua kondisi
dataset. Secara keseluruhan, ketiga model LLM yang diuji secara zero-shot melampaui
performa IndoBERT yang telah melalui proses fine-tuning, mengindikasikan bahwa kapasitas
pemahaman bahasa LLM skala besar cukup kuat untuk tugas analisis sentimen bahasa
Indonesia tanpa pelatihan domain khusus.
Collections
- Informatics Engineering [2730]
