Pribadi
AI Behavioral Runtime
Mengarahkan penalaran model lewat prinsip yang ditentukan sejak awal. Skor benchmark naik, tapi setiap langkah ada harganya.
Hasil sementaraPengarahan berhasil. Mengharuskan model bernalar mengikuti prinsip yang sudah ditentukan menaikkan skor benchmark tanpa menyentuh penalaran bawaannya — hasil yang memang dicari eksperimen ini. Tapi tidak gratis: pengarahan dibayar di setiap langkah, dan apa pun yang tidak pernah dijelaskan oleh prinsipnya tetap belum terpecahkan, sama seperti sebelumnya.
- Stack
- Reasoning runtime / Gemini 3.1 Pro
- Aspek dibandingkan
- 4
- Batasan terbuka
- 4
01 / Pertanyaannya
Bisakah sekumpulan prinsip yang sudah ditentukan mengarahkan penalaran model ke arah yang lebih baik, tanpa menyentuh penalarannya sendiri?
Model kelas Flash, atau model apa pun yang bukan frontier, bisa menyimpan banyak pengetahuan tetapi tetap gagal karena mengarahkan penalarannya ke jalan yang salah. Menguasai materi dan memilih apa yang harus dilakukan dengannya adalah dua kemampuan yang berbeda.
Ini bukan hanya masalah model kecil. Gemini 3.1 Pro adalah salah satu contoh yang teramati: kemampuannya setara model besar, tetapi tetap berakhir di jawaban yang salah karena memulai dari jalan yang salah.
02 / Jalannya eksperimen
Ikuti jalannya langkah demi langkah.
Empat langkah, sesuai urutan kejadiannya.
02 / Jalannya eksperimen / langkah 01 dari 04
Amati di mana prosesnya mulai salah.
Bukan fakta apa yang kurang — melainkan belokan mana yang diambil penalarannya. Kegagalan yang penting adalah kegagalan arah: langkah pertama yang tampak masuk akal, tapi tidak bisa diselamatkan oleh langkah apa pun sesudahnya.
03 / Pendekatannya
Dua versi, satu pertanyaan.
Beralih di antara keduanya. Susunan dan urutannya sama, jadi yang berbeda hanya isinya.
Model bekerja sendiri
Model menerima masalah dan memilih arahnya sendiri. Murah dan singkat, tapi sepenuhnya bergantung pada apakah langkah pertamanya kebetulan tepat.
- Tanpa beban pengarahan — kamu hanya membayar penalarannya.
- Arahnya bergantung pada pilihan model kali itu.
- Langkah pertama yang salah jarang bisa dipulihkan di tengah proses.
- Kegagalannya tidak memberi petunjuk cara mencegah kegagalan berikutnya.
04 / Hasilnya
Satu per satu, per aspek.
Pilih sebuah baris untuk membaca kenapa hasilnya begitu.
Dipandu prinsip — jelas
Arah penalaran
Prinsip yang jelas menjaga proses tetap mengarah ke masalah yang diberikan. Inilah alasan runtime ini ada, dan bagian inilah yang berhasil.
Dinilai pada masalah yang sama, dengan model yang sama. Skor benchmark naik; angka di baliknya belum boleh dipublikasikan.
05 / Untung-rugi
Tidak ada yang gratis.
Harga dari setiap keuntungan, di baris yang sama dengan keuntungannya.
Yang didapat
Prinsip yang benar-benar dituliskan membantu model bekerja ke arah yang lebih tepat, dari proses ke proses.
Harga yang dibayar
Prinsip itu harus ditulis lebih dulu, dan prinsip yang salah kini salah secara konsisten, bukan sesekali.
Yang didapat
Skor benchmark model itu naik tanpa mengubah modelnya.
Harga yang dibayar
Penalaran jadi lebih mahal: pengarahan tambahan dibawa di setiap langkah, jadi kenaikannya dibayar dengan token.
Yang didapat
Penalaran bawaan dibiarkan utuh, jadi runtime memanfaatkan apa pun yang sudah dikuasai model.
Harga yang dibayar
Runtime juga mewarisi apa pun yang tidak dikuasai model. Runtime mengarahkan penalaran; ia tidak memperbaikinya.
06 / Masih terbuka
Yang belum terpecahkan.
4 batasan yang belum dijawab eksperimen ini.
Kasus di luar prinsip yang sudah ditentukan masih belum terpecahkan. Runtime tidak punya cadangan untuk kasus itu dan tidak mendeteksi saat prosesnya keluar dari cakupan.
Kenaikannya baru diamati pada satu model. Apakah prinsip yang sama membantu di keluarga model lain belum diuji.
Biaya pengarahan belum dipisahkan per prinsip, jadi belum ada bukti prinsip mana yang benar-benar sepadan.
Belum ada angka benchmark yang boleh dipublikasikan.
Kesimpulan sementara
Pengarahan berhasil. Mengharuskan model bernalar mengikuti prinsip yang sudah ditentukan menaikkan skor benchmark tanpa menyentuh penalaran bawaannya — hasil yang memang dicari eksperimen ini. Tapi tidak gratis: pengarahan dibayar di setiap langkah, dan apa pun yang tidak pernah dijelaskan oleh prinsipnya tetap belum terpecahkan, sama seperti sebelumnya.
Catatan proses
- Runtime hanya mengarahkan prosesnya. Penalaran bawaan model dibiarkan persis seperti semula.
- Skor benchmark naik, dan biaya penalarannya ikut naik.
- Kasus yang tidak pernah dijelaskan oleh prinsipnya masih belum terpecahkan, dan runtime tidak sadar saat kasus itu keluar dari cakupannya.