Evaluasi Kinerja Model AI Generatif Dalam Pelabelan Sentimen Menggunakan Macro-average dan Cohen’s Kappa (Studi Kasus : Komentar TikTok Bertema Olahraga Lari)
Abstract
Perkembangan media sosial, khususnya TikTok, menjadikan kolom komentar
sebagai sumber opini publik yang kaya dan beragam. Banyaknya data komentar
mendorong pemanfaatan kecerdasan buatan generatif untuk melakukan pelabelan
sentimen secara otomatis. Namun, perbedaan kemampuan antar model dalam
memahami bahasa informal berbahasa Indonesia perlu dievaluasi secara sistematis.
Penelitian ini bertujuan mengevaluasi kinerja tiga model AI generatif, yaitu
ChatGPT (GPT-5.2), Gemini 1.5 Flash, dan DeepSeek, dalam pelabelan sentimen
komentar TikTok bertema olahraga lari dengan menggunakan label manual sebagai
ground truth. Evaluasi dilakukan menggunakan confusion matrix, Macro-Average
(macro-precision, macro-recall, dan macro-F1 score), serta Cohen’s Kappa. Hasil
menunjukkan adanya ketidakseimbangan kelas data dengan dominasi kelas netral.
DeepSeek memperoleh performa terbaik dengan macro-F1 sebesar 0.7924 dan
Cohen’s Kappa sebesar 0.6786 (kategori kuat), diikuti Gemini (macro-F1 0.7572;
Kappa 0.6219), dan ChatGPT (macro-F1 0.5329; Kappa 0.3179). Analisis
menunjukkan bahwa ChatGPT cenderung bias terhadap kelas netral, Gemini
cenderung mengklasifikasikan teks ambigu sebagai positif, sedangkan DeepSeek
memiliki performa paling konsisten dan seimbang. Penelitian ini menyimpulkan
bahwa DeepSeek dan Gemini layak digunakan sebagai asisten pelabelan semi-
otomatis.
Collections
- Statistics [1327]
