GitHub merilis ReviewBench, benchmark terbuka untuk mengukur kemampuan agen AI dalam melakukan code review. Pengumuman pada 5 Oktober 2026 ini datang ketika semakin banyak tim memakai agen untuk membaca pull request, mencari bug, dan menentukan perubahan mana yang perlu diperiksa manusia sebelum kode masuk ke produksi.

Masalah yang ingin diselesaikan GitHub cukup praktis: hasil code review dari AI sulit dibandingkan secara adil. Satu sistem mungkin menemukan lebih banyak masalah, tetapi juga menghasilkan lebih banyak noise. Sistem lain bisa lebih hemat komentar, namun melewatkan bug yang lebih serius. Tanpa benchmark dengan data dan aturan penilaian yang konsisten, angka-angka itu tidak banyak membantu tim memilih alat.

Dataset dibuat menyerupai pull request nyata

ReviewBench berisi 219 pull request dari 187 repositori open source berlisensi, mencakup 19 bahasa pemrograman. GitHub mengatakan distribusi bahasa dan ukuran repositorinya dimodelkan dari analisis terhadap 103,9 juta pull request. Dataset itu tidak sekadar mengambil perubahan kecil yang mudah diuji: ukuran pull request sengaja diberi bobot lebih besar pada perubahan menengah hingga besar agar benchmark lebih dekat dengan pekerjaan review sehari-hari.

Dalam ringkasan yang diterbitkan GitHub, TypeScript menjadi bahasa dengan 68 pull request, diikuti Python dengan 41, C# dengan 25, Go dengan 19, dan JavaScript dengan 15. Sebanyak 78 pull request berisi lebih dari 1.000 baris tambahan dan penghapusan. Angka tersebut tidak berarti semua proyek memakai pola yang sama, tetapi memberi gambaran tentang jenis perubahan yang ingin diuji oleh benchmark ini.

Temuan tidak berasal dari satu sumber

Bagian penting ReviewBench adalah golden set atau kumpulan temuan rujukan yang dipakai untuk menilai agen. GitHub menggabungkan temuan dari reviewer manusia, perubahan lanjutan yang dibuat penulis pull request, alat analisis statis, serta beberapa model bahasa. Temuan yang tumpang tindih dideduplikasi, lalu divalidasi memakai rubrik bersama.

Setiap temuan diberi label tingkat keparahan dan kategori, termasuk correctness, security, reliability, maintainability, dan testing. GitHub menyebut senior engineer yang tidak ikut membangun dataset melakukan pelabelan ulang untuk audit. Hasil penilaian mereka memiliki tingkat kesepakatan 96,6 persen dengan label golden set. Angka ini adalah hasil validasi internal GitHub, bukan bukti bahwa benchmark tersebut bebas dari bias.

ReviewBench memakai metrik grounded precision dan grounded recall untuk membandingkan temuan yang sudah ada di golden set. Ada juga metrik augmented yang menilai temuan baru yang tidak tercantum di dalamnya. Pendekatan kedua penting karena golden set tetap bisa melewatkan masalah yang baru ditemukan oleh agen. GitHub tetap menempatkan grounded recall sebagai perbandingan utama antar-sistem agar hasilnya lebih mudah disejajarkan.

GitHub mengaitkannya dengan eksperimen Copilot

GitHub menggunakan ReviewBench untuk mengevaluasi Copilot code review. Dalam satu eksperimen pada tier lite, GitHub menggabungkan beberapa proses review model menjadi satu hasil. Menurut data yang dipublikasikan GitHub, pengujian offline memperkirakan precision naik 4,45 persen, recall naik 12,88 persen, dan biaya per review turun 23,7 persen. Eksperimen A/B produksi kemudian mencatat addressed rate naik 8 persen, recall naik 13,58 persen, volume komentar naik 25 persen, dan biaya per review turun 8 persen dibanding kontrol.

Perbandingan ini tetap perlu dibaca sebagai klaim dan pengukuran dari pembuat produk. Eksperimen offline bukan pengganti pengujian pada pengguna, dan hasil Copilot tidak otomatis menggambarkan kinerja semua agen code review. Nilai ReviewBench justru ada pada kemungkinan pihak lain menjalankan sistem mereka sendiri dengan dataset dan rubrik yang sama.

Benchmark terbuka, tetapi bukan jawaban final

ReviewBench menyediakan dataset, metodologi evaluasi, konfigurasi model penilai, dan runner untuk pengujian mandiri. Pengembang dapat mencoba test set berisi 25 pull request sebelum menjalankan evaluasi penuh terhadap 219 pull request dalam tiga putaran. Hasil leaderboard tetap melalui peninjauan maintainer sebelum dipublikasikan.

Bagi tim engineering, benchmark semacam ini bisa membantu menjawab pertanyaan yang lebih berguna daripada sekadar “model mana yang paling pintar?” Misalnya: apakah agen lebih kuat menemukan masalah keamanan atau bug correctness, seberapa banyak noise yang harus ditoleransi reviewer, dan apakah peningkatan recall sepadan dengan tambahan waktu serta biaya.

Namun angka benchmark tidak menghapus kebutuhan atas review manusia. Kualitas label, pilihan repositori, model penilai, dan definisi “temuan yang valid” tetap memengaruhi hasil. ReviewBench memberi titik awal yang lebih terbuka untuk membandingkan alat code review; keputusan produksi tetap perlu mempertimbangkan kode, risiko, dan kebiasaan kerja tiap tim.

Sumber https://github.blog/ai-and-ml/github-copilot/reviewbench-an-open-benchmark-for-ai-code-review/ Sumber tambahan: https://review-bench.ai/