
Papan peringkat membuat pilihan yang rumit terlihat sangat sederhana. Temukan skor tertinggi, pilih model itu, dan lanjutkan. Kesulitan kembali muncul ketika tugas nyata pertama tiba dengan dokumen yang formatnya buruk, instruksi yang ambigu, atau tenggat waktu. Di situlah saya akan memulai perbandingan: dengan pekerjaan yang perlu diselesaikan dan deskripsi yang jelas tentang seperti apa hasil yang baik itu.
Apa yang sebenarnya diukur oleh skor tersebut
Benchmark adalah kumpulan tugas yang ditentukan dan metode untuk memberi skor pada respons. Nilainya berasal dari membuat perbandingan dapat diulang. Model yang berkinerja baik pada tugas-tugas tersebut telah menunjukkan sesuatu yang berguna dalam kondisi tersebut. Pertanyaan selanjutnya adalah seberapa mirip kondisi tersebut dengan kondisi yang Anda pedulikan.
Penelitian HELM asli Stanford, yang diperkenalkan pada tahun 2022, berpendapat untuk mengevaluasi model bahasa di berbagai skenario dan berbagai ukuran. Akurasi hanyalah satu bagian dari pendekatan itu; efisiensi, ketahanan, dan properti lainnya juga penting. Penelitian lama tersebut berguna di sini untuk metodenya, bukan sebagai peringkat produk saat ini.
Buat tes menyerupai hari Selasa biasa
Misalkan Anda ingin bantuan untuk mengubah pesan pelanggan menjadi daftar mingguan masalah yang berulang. Kuis pengetahuan umum mungkin hanya memberi tahu Anda sedikit tentang apakah suatu sistem mempertahankan makna keluhan, menangani kalimat yang tidak jelas, atau menghindari mengarang maksud pelanggan. Percobaan Anda sendiri dapat menggunakan sejumlah kecil contoh non-rahasia dengan kategori yang diharapkan dituliskan sebelumnya.
Sertakan contoh yang mudah, contoh yang rumit, dan kasus di mana jawaban yang benar adalah meminta klarifikasi. Pertahankan instruksi dan materi sumber yang tersedia sama untuk setiap model. Ini tidak akan menghasilkan vonis ilmiah tentang setiap kemungkinan penggunaan, tetapi dapat mengungkapkan ketidaksesuaian sebelum Anda membangun alur kerja di sekitarnya.
Hitung waktu yang dihabiskan untuk memperbaiki jawaban
Pertimbangkan percobaan ilustratif dari sepuluh ringkasan singkat. Sistem A membutuhkan waktu sepuluh menit untuk dijalankan dan dua puluh menit untuk diperiksa dan diperbaiki. Sistem B membutuhkan waktu lima belas menit untuk dijalankan dan lima menit untuk ditinjau. Jika keduanya pada akhirnya memberikan hasil yang dapat diterima, total pekerjaan adalah tiga puluh menit untuk A dan dua puluh menit untuk B. Respons pertama yang lebih cepat tidak menghasilkan pekerjaan yang selesai lebih cepat.
Inilah ide di balik biaya per hasil yang bermanfaat. Biaya tersebut dapat mencakup biaya berlangganan, waktu tunggu, pengecekan, dan konsekuensi dari kesalahan. Angka-angka hipotetis ini bukanlah ukuran dari produk tertentu. Angka-angka ini menunjukkan mengapa perbedaan kecil pada skor publik mungkin kurang penting daripada masalah yang berulang dalam proses aktual Anda.
Jawaban yang lancar tetap membutuhkan bukti
Kalibrasi menggambarkan seberapa baik kepercayaan yang dinyatakan oleh suatu sistem sesuai dengan kebenarannya. Bagi pembaca, masalah praktisnya adalah apakah ketidakpastian terlihat ketika buktinya lemah. Jawaban yang memberikan angka yang rapi tanpa dukungan bisa lebih sulit digunakan daripada jawaban yang mengidentifikasi input yang hilang.
Kerangka Kerja Manajemen Risiko AI sukarela NIST menempatkan evaluasi di dalam pertanyaan yang lebih luas tentang bagaimana suatu sistem digunakan dan risiko apa yang mengikutinya. Saya mengambil pelajaran sederhana dari itu: putuskan terlebih dahulu output mana yang memerlukan pemeriksaan independen, informasi apa yang harus tetap berada di luar alat, dan apa yang akan menyebabkan Anda berhenti menggunakannya untuk tugas tertentu.
Simpan catatan kecil tentang keputusan tersebut
Simpan versi model, tanggal pengujian, instruksi, dan beberapa hasil representatif. Tinjau kembali pilihan tersebut ketika produk atau pekerjaan Anda berubah secara material. Contoh yang disimpan seringkali lebih informatif daripada ingatan bahwa seorang asisten merasa lebih baik beberapa bulan yang lalu.
Preferensi saya adalah daftar pendek yang didukung oleh uji coba yang transparan. Papan peringkat dapat membantu Anda menemukan kandidat. Pilihan akhir harus didasarkan pada apakah alat tersebut secara andal membantu Anda menyelesaikan pekerjaan yang sebenarnya Anda miliki.
Pilih sesuai pekerjaan yang perlu selesai
Bandingkan model pada tugas-tugas representatif, menggunakan kondisi yang sama, dan hitung waktu peninjauan bersama dengan kecepatan respons.
Apakah skor benchmark yang lebih tinggi berarti model akan lebih baik untuk pekerjaan saya?
Ini adalah bukti tentang tugas dan kondisi benchmark. Uji contoh representatif dari alur kerja Anda sendiri sebelum memperlakukannya sebagai jawaban umum.
Ikut berdiskusi
Komentar ditampilkan setelah ditinjau dan disetujui. Pendapat berbeda yang relevan tetap diterima.