# AI Behavioral Runtime

> Mengarahkan penalaran model lewat prinsip yang ditentukan sejak awal. Skor benchmark naik, tapi setiap langkah ada harganya.

- Situs: isnan lab (https://lab.falah-isnan.com/experiments/ai-behavioral-runtime)
- Penulis: Falah Isnan (https://falah-isnan.com/)
- Terbit: 2026-09-23
- Diperbarui: 2026-09-23
- Stack: Reasoning runtime / Gemini 3.1 Pro
- Akses: Catatan riset
- Hasil sementara: Pengarahan berhasil. Mengharuskan model bernalar mengikuti prinsip yang sudah ditentukan menaikkan skor benchmark tanpa menyentuh penalaran bawaannya — hasil yang memang dicari eksperimen ini. Tapi tidak gratis: pengarahan dibayar di setiap langkah, dan apa pun yang tidak pernah dijelaskan oleh prinsipnya tetap belum terpecahkan, sama seperti sebelumnya.

## Pertanyaannya

Bisakah sekumpulan prinsip yang sudah ditentukan mengarahkan penalaran model ke arah yang lebih baik, tanpa menyentuh penalarannya sendiri?

Model kelas Flash, atau model apa pun yang bukan frontier, bisa menyimpan banyak pengetahuan tetapi tetap gagal karena mengarahkan penalarannya ke jalan yang salah. Menguasai materi dan memilih apa yang harus dilakukan dengannya adalah dua kemampuan yang berbeda.

Ini bukan hanya masalah model kecil. Gemini 3.1 Pro adalah salah satu contoh yang teramati: kemampuannya setara model besar, tetapi tetap berakhir di jawaban yang salah karena memulai dari jalan yang salah.

## Jalannya eksperimen

1. **Amati di mana prosesnya mulai salah.** Bukan fakta apa yang kurang — melainkan belokan mana yang diambil penalarannya. Kegagalan yang penting adalah kegagalan arah: langkah pertama yang tampak masuk akal, tapi tidak bisa diselamatkan oleh langkah apa pun sesudahnya.
2. **Tuliskan prinsipnya.** Arah yang seharusnya diambil, dirumuskan sebagai prinsip yang eksplisit, bukan prompt yang lebih panjang. Runtime memegang prinsip itu dan mengharuskan model bekerja mengikutinya.
3. **Biarkan penalaran bawaannya.** Tidak ada yang menggantikan cara model bernalar. Runtime hanya mengarahkan prosesnya, jadi apa pun yang sudah dikuasai model tetap tersedia di bawahnya.
4. **Jalankan lagi dan hitung biayanya.** Masalah yang sama, lewat runtime. Periksa kedua sisinya: di mana hasilnya berubah, dan berapa tambahan beban pengarahan di setiap langkah.

## Pendekatan yang dibandingkan

### Model bekerja sendiri

Model menerima masalah dan memilih arahnya sendiri. Murah dan singkat, tapi sepenuhnya bergantung pada apakah langkah pertamanya kebetulan tepat.

- Tanpa beban pengarahan — kamu hanya membayar penalarannya.
- Arahnya bergantung pada pilihan model kali itu.
- Langkah pertama yang salah jarang bisa dipulihkan di tengah proses.
- Kegagalannya tidak memberi petunjuk cara mencegah kegagalan berikutnya.

### Model di dalam runtime

Model yang sama, diharuskan bekerja mengikuti prinsip yang ditentukan sejak awal. Penalarannya tetap milik model; arahnya tidak.

- Arahnya ditetapkan di awal, bukan ditemukan ulang di setiap proses.
- Penalaran bawaan tidak disentuh, jadi tidak ada kemampuan yang hilang.
- Setiap langkah membawa pengarahan, dan pengarahan itu tidak gratis.
- Di luar prinsip yang sudah ditentukan, tidak ada yang menahan prosesnya.

## Hasilnya

Dinilai pada masalah yang sama, dengan model yang sama. Skor benchmark naik; angka di baliknya belum boleh dipublikasikan.

- **Arah penalaran** — Unggul di: Model di dalam runtime (clear). Prinsip yang jelas menjaga proses tetap mengarah ke masalah yang diberikan. Inilah alasan runtime ini ada, dan bagian inilah yang berhasil.
- **Hasil benchmark** — Unggul di: Model di dalam runtime (clear). Cukup untuk menaikkan skor benchmark model itu. Kenaikannya datang dari berkurangnya proses yang salah arah, bukan karena model tiba-tiba tahu hal baru.
- **Biaya per proses** — Unggul di: Model bekerja sendiri (clear). Pengarahan harus dibawa sepanjang penalaran, jadi biayanya dibayar di setiap langkah. Proses tanpa pengarahan lebih murah, dan kadang juga benar.
- **Kasus di luar prinsip** — Unggul di: Belum terjawab (narrow). Belum terjawab. Kasus yang tidak dijelaskan oleh prinsipnya tidak tertangani oleh kedua pihak — runtime tidak punya apa pun untuk mengarahkan, dan proses tanpa pengarahan kembali menebak-nebak.

## Untung-rugi

- Keuntungan: Prinsip yang benar-benar dituliskan membantu model bekerja ke arah yang lebih tepat, dari proses ke proses. Harga yang dibayar: Prinsip itu harus ditulis lebih dulu, dan prinsip yang salah kini salah secara konsisten, bukan sesekali.
- Keuntungan: Skor benchmark model itu naik tanpa mengubah modelnya. Harga yang dibayar: Penalaran jadi lebih mahal: pengarahan tambahan dibawa di setiap langkah, jadi kenaikannya dibayar dengan token.
- Keuntungan: Penalaran bawaan dibiarkan utuh, jadi runtime memanfaatkan apa pun yang sudah dikuasai model. Harga yang dibayar: Runtime juga mewarisi apa pun yang tidak dikuasai model. Runtime mengarahkan penalaran; ia tidak memperbaikinya.

## Yang belum terpecahkan

1. Kasus di luar prinsip yang sudah ditentukan masih belum terpecahkan. Runtime tidak punya cadangan untuk kasus itu dan tidak mendeteksi saat prosesnya keluar dari cakupan.
2. Kenaikannya baru diamati pada satu model. Apakah prinsip yang sama membantu di keluarga model lain belum diuji.
3. Biaya pengarahan belum dipisahkan per prinsip, jadi belum ada bukti prinsip mana yang benar-benar sepadan.
4. Belum ada angka benchmark yang boleh dipublikasikan.

## Kesimpulan sementara

Pengarahan berhasil. Mengharuskan model bernalar mengikuti prinsip yang sudah ditentukan menaikkan skor benchmark tanpa menyentuh penalaran bawaannya — hasil yang memang dicari eksperimen ini. Tapi tidak gratis: pengarahan dibayar di setiap langkah, dan apa pun yang tidak pernah dijelaskan oleh prinsipnya tetap belum terpecahkan, sama seperti sebelumnya.

## Catatan proses

- Runtime hanya mengarahkan prosesnya. Penalaran bawaan model dibiarkan persis seperti semula.
- Skor benchmark naik, dan biaya penalarannya ikut naik.
- Kasus yang tidak pernah dijelaskan oleh prinsipnya masih belum terpecahkan, dan runtime tidak sadar saat kasus itu keluar dari cakupannya.
