Pribadi

AI Behavioral Runtime

Mengarahkan penalaran model lewat prinsip yang ditentukan sejak awal. Skor benchmark naik, tapi setiap langkah ada harganya.

Hasil sementaraPengarahan berhasil. Mengharuskan model bernalar mengikuti prinsip yang sudah ditentukan menaikkan skor benchmark tanpa menyentuh penalaran bawaannya — hasil yang memang dicari eksperimen ini. Tapi tidak gratis: pengarahan dibayar di setiap langkah, dan apa pun yang tidak pernah dijelaskan oleh prinsipnya tetap belum terpecahkan, sama seperti sebelumnya.

Stack
Reasoning runtime / Gemini 3.1 Pro
Aspek dibandingkan
4
Batasan terbuka
4
BACA HASILNYA

01 / Pertanyaannya

Bisakah sekumpulan prinsip yang sudah ditentukan mengarahkan penalaran model ke arah yang lebih baik, tanpa menyentuh penalarannya sendiri?

Model kelas Flash, atau model apa pun yang bukan frontier, bisa menyimpan banyak pengetahuan tetapi tetap gagal karena mengarahkan penalarannya ke jalan yang salah. Menguasai materi dan memilih apa yang harus dilakukan dengannya adalah dua kemampuan yang berbeda.

Ini bukan hanya masalah model kecil. Gemini 3.1 Pro adalah salah satu contoh yang teramati: kemampuannya setara model besar, tetapi tetap berakhir di jawaban yang salah karena memulai dari jalan yang salah.

FIG. — THE QUESTION

02 / Jalannya eksperimen

Ikuti jalannya langkah demi langkah.

Empat langkah, sesuai urutan kejadiannya.

FIG. 0102 / JALANNYA EKSPERIMEN

02 / Jalannya eksperimen / langkah 01 dari 04

Amati di mana prosesnya mulai salah.

Bukan fakta apa yang kurang — melainkan belokan mana yang diambil penalarannya. Kegagalan yang penting adalah kegagalan arah: langkah pertama yang tampak masuk akal, tapi tidak bisa diselamatkan oleh langkah apa pun sesudahnya.

03 / Pendekatannya

Dua versi, satu pertanyaan.

Beralih di antara keduanya. Susunan dan urutannya sama, jadi yang berbeda hanya isinya.

FIG. — TANPA PENGARAHAN

Model bekerja sendiri

Model menerima masalah dan memilih arahnya sendiri. Murah dan singkat, tapi sepenuhnya bergantung pada apakah langkah pertamanya kebetulan tepat.

  • Tanpa beban pengarahan — kamu hanya membayar penalarannya.
  • Arahnya bergantung pada pilihan model kali itu.
  • Langkah pertama yang salah jarang bisa dipulihkan di tengah proses.
  • Kegagalannya tidak memberi petunjuk cara mencegah kegagalan berikutnya.

04 / Hasilnya

Satu per satu, per aspek.

Pilih sebuah baris untuk membaca kenapa hasilnya begitu.

Dipandu prinsip — jelas

Arah penalaran

Prinsip yang jelas menjaga proses tetap mengarah ke masalah yang diberikan. Inilah alasan runtime ini ada, dan bagian inilah yang berhasil.

Dinilai pada masalah yang sama, dengan model yang sama. Skor benchmark naik; angka di baliknya belum boleh dipublikasikan.

05 / Untung-rugi

Tidak ada yang gratis.

Harga dari setiap keuntungan, di baris yang sama dengan keuntungannya.

  1. Yang didapat

    Prinsip yang benar-benar dituliskan membantu model bekerja ke arah yang lebih tepat, dari proses ke proses.

    Harga yang dibayar

    Prinsip itu harus ditulis lebih dulu, dan prinsip yang salah kini salah secara konsisten, bukan sesekali.

  2. Yang didapat

    Skor benchmark model itu naik tanpa mengubah modelnya.

    Harga yang dibayar

    Penalaran jadi lebih mahal: pengarahan tambahan dibawa di setiap langkah, jadi kenaikannya dibayar dengan token.

  3. Yang didapat

    Penalaran bawaan dibiarkan utuh, jadi runtime memanfaatkan apa pun yang sudah dikuasai model.

    Harga yang dibayar

    Runtime juga mewarisi apa pun yang tidak dikuasai model. Runtime mengarahkan penalaran; ia tidak memperbaikinya.

06 / Masih terbuka

Yang belum terpecahkan.

4 batasan yang belum dijawab eksperimen ini.

  1. Kasus di luar prinsip yang sudah ditentukan masih belum terpecahkan. Runtime tidak punya cadangan untuk kasus itu dan tidak mendeteksi saat prosesnya keluar dari cakupan.

  2. Kenaikannya baru diamati pada satu model. Apakah prinsip yang sama membantu di keluarga model lain belum diuji.

  3. Biaya pengarahan belum dipisahkan per prinsip, jadi belum ada bukti prinsip mana yang benar-benar sepadan.

  4. Belum ada angka benchmark yang boleh dipublikasikan.

FIG. — STILL OPEN

Kesimpulan sementara

Pengarahan berhasil. Mengharuskan model bernalar mengikuti prinsip yang sudah ditentukan menaikkan skor benchmark tanpa menyentuh penalaran bawaannya — hasil yang memang dicari eksperimen ini. Tapi tidak gratis: pengarahan dibayar di setiap langkah, dan apa pun yang tidak pernah dijelaskan oleh prinsipnya tetap belum terpecahkan, sama seperti sebelumnya.

Catatan proses

  • Runtime hanya mengarahkan prosesnya. Penalaran bawaan model dibiarkan persis seperti semula.
  • Skor benchmark naik, dan biaya penalarannya ikut naik.
  • Kasus yang tidak pernah dijelaskan oleh prinsipnya masih belum terpecahkan, dan runtime tidak sadar saat kasus itu keluar dari cakupannya.

Memuat isnan lab…

Loading

Still loading. The connection may be slow. This page could not load. Check the connection and reload.