Lewati ke konten utama
Jangan Terjebak Skor MMLU: Panduan Membaca Benchmark Model AI
AI Models & Benchmark

Jangan Terjebak Skor MMLU: Panduan Membaca Benchmark Model AI

Membaca benchmark model AI tidak semudah melihat skor persentase. Pelajari cara memahami metrik evaluasi seperti MMLU, GSM8K, dan HumanEval agar tidak salah memilih model LLM.

Tim Kariwaya

Hampir setiap minggu kita disuguhi peluncuran model kecerdasan buatan baru. Brosur rilisnya selalu tampak mengesankan: grafik batang yang menjulang tinggi, persentase keunggulan yang diklaim melampaui kompetitor, dan tabel perbandingan yang penuh warna. Di puncak lembar data tersebut biasanya tertulis skor MMLU, GSM8K, atau HumanEval yang mendekati angka sempurna.

Namun, ketika Anda mencoba menggunakan model tersebut untuk menerjemahkan dokumen hukum berbahasa Indonesia atau menulis kode Python spesifik untuk API internal perusahaan, hasilnya sering kali mengecewakan. Model yang katanya mengalahkan GPT-4 di atas kertas justru mendadak “halusinasi” atau menghasilkan kode yang usang.

Ada jurang lebar antara skor tes laboratorium dengan kegunaan praktis sehari-hari. Memahami cara membaca data evaluasi ini dengan kritis akan menyelamatkan Anda dari pemborosan anggaran komputasi dan waktu integrasi yang sia-sia.

Mengapa Angka Tinggi di Atas Kertas Sering Kali Menipu

Ada fenomena menarik dalam psikologi sosial yang dikenal sebagai Hukum Goodhart: ketika sebuah metrik diubah menjadi target, ia tidak lagi menjadi metrik yang baik. Hal ini sedang terjadi pada dunia evaluasi model bahasa besar (LLM).

Ketika para pembuat model AI tahu bahwa produk mereka akan dinilai berdasarkan set pertanyaan ujian tertentu, fokus mereka bergeser. Alih-alih melatih model agar lebih cerdas secara umum, ada kecenderungan kuat untuk mengoptimalkan model agar bisa menjawab pertanyaan ujian tersebut dengan tepat. Praktik ini dikenal sebagai kebocoran data benchmark (benchmark contamination).

Bayangkan seorang siswa yang mendapatkan bocoran soal ujian akhir semester. Dia menghafal kunci jawaban tanpa benar-benar memahami konsep dasarnya. Ketika ujian berlangsung, nilainya sempurna. Namun saat dia diminta menyelesaikan masalah nyata di lapangan kerja, dia kebingungan.

[Data: estimasi persentase kebocoran dataset benchmark populer ke dalam data pelatihan LLM modern] model komersial saat ini diduga kuat telah terpapar oleh dataset evaluasi selama fase pelatihan pra-rilis. Akibatnya, skor tinggi yang ditampilkan dalam tabel promosi tidak mencerminkan kemampuan penalaran yang sesungguhnya, melainkan kemampuan mengingat kembali (recall) data yang sudah pernah dilihat.

Membedah Tiga Metrik Utama yang Paling Sering Disalahpahami

Untuk membaca laporan rilis dengan jeli, kita harus memahami apa yang sebenarnya diuji oleh metrik-metrik populer tersebut, dan di mana letak kelemahan terbesarnya.

1. MMLU (Massive Multitask Language Understanding)

Ini adalah standar emas yang paling sering dipamerkan. MMLU menguji model pada puluhan subjek akademik, mulai dari matematika dasar, sejarah, hukum, hingga kedokteran profesional.

  • Bentuk Tes: Pilihan ganda (A, B, C, D).
  • Kelemahan Nyata: Format pilihan ganda tidak menguji kemampuan menghasilkan tulisan yang koheren. Model bisa sangat mahir menebak opsi yang benar dalam struktur teratur, tetapi gagal total saat diminta menulis esai analisis yang mengalir alami. Selain itu, banyak soal di MMLU yang terbukti memiliki jawaban ganda atau kesalahan penulisan soal yang membuat skornya bias.

2. GSM8K (Grade School Math 8K)

Dataset yang berisi ribuan masalah matematika tingkat sekolah dasar yang membutuhkan penalaran multi-langkah.

  • Bentuk Tes: Menyelesaikan soal cerita matematika.
  • Kelemahan Nyata: Model AI tidak benar-benar melakukan kalkulasi seperti kalkulator. Mereka memprediksi kata berikutnya berdasarkan pola. Skor GSM8K yang tinggi sering kali dicapai dengan teknik prompting khusus seperti Chain of Thought (CoT). Jika instruksi yang Anda berikan di dunia nyata tidak memicu penalaran bertahap ini, kemampuan matematika model akan turun drastis.

3. HumanEval

Tolok ukur yang dirancang untuk mengevaluasi kemampuan pemrograman, khususnya dalam bahasa Python.

  • Bentuk Tes: Model diminta melengkapi fungsi berdasarkan deskripsi docstring, lalu kodenya dijalankan untuk melihat apakah lolos unit test.
  • Kelemahan Nyata: Soal-soal dalam HumanEval sangat condong pada algoritma dasar dan struktur data standar (seperti membalik string atau mencari nilai maksimum). Ini sangat berbeda dengan pekerjaan rekayasa perangkat lunak modern yang melibatkan integrasi pustaka pihak ketiga, membaca dokumentasi API terbaru yang dinamis, atau memahami arsitektur kode berskala besar.

Metode Alternatif: Cara Menilai Model Secara Objektif

Jika lembar spesifikasi resmi tidak bisa sepenuhnya dipercaya, bagaimana cara kita menemukan model yang benar-benar cocok untuk kebutuhan bisnis atau proyek pribadi?

Langkah pertama adalah beralih ke evaluasi berbasis preferensi manusia secara massal. Platform seperti Chatbot Arena dari LMSYS (Large Model Systems Organization) menyediakan alternatif yang jauh lebih realistis. Menggunakan sistem peringkat Elo (seperti dalam permainan catur), dua model anonim diadu untuk menjawab pertanyaan yang sama dari pengguna asli secara acak. Pengguna kemudian memilih jawaban mana yang lebih baik.

Karena pertanyaan yang diajukan adalah masalah dunia nyata yang tidak terstruktur—mulai dari curhat masalah emosional hingga mencari kutipan kode yang rumit—skor Elo Arena jauh lebih sulit untuk dimanipulasi dengan cara menghafal dokumen tes.

Langkah kedua, dan yang paling krusial, adalah membangun dataset uji internal Anda sendiri. Jika tim Anda berniat menggunakan LLM untuk merangkum laporan keuangan perusahaan, buatlah 50 sampel dokumen keuangan nyata beserta hasil rangkuman ideal yang ditulis oleh staf ahli Anda. Gunakan sampel ini untuk menguji setiap model baru secara mandiri. Ini memberikan gambaran performa yang jauh lebih presisi dibandingkan membandingkan skor MMLU global yang abstrak.

Jangan biarkan keputusan teknologi Anda didikte oleh grafik pemasaran. Cobalah model tersebut secara langsung dengan kasus penggunaan paling spesifik yang Anda miliki. Jika Anda ingin melihat perbandingan performa, kecepatan, dan biaya operasional dari berbagai model AI terbaru secara langsung, Anda bisa meninjau katalog perbandingan mendalam kami di halaman daftar model Kariwaya.