Pribadi

RAG vs wiki Markdown

Knowledge base yang sama dibangun dua kali: dengan indeks RAG, dan sebagai LLM Wiki Markdown yang ditautkan manual. Tidak ada yang menang telak.

Hasil sementaraRAG unggul dalam efisiensi token dan kecepatan, dan keunggulan itu makin lebar seiring knowledge base membesar. LLM Wiki Markdown unggul dalam kemudahan perawatan dan keterprediksian. Untuk knowledge base kecil sampai menengah yang kamu tulis sendiri, pendekatan Markdown lebih efektif di antara keduanya: hubungannya eksplisit, jadi kamu bisa memperkirakan apa yang akan dibaca model.

Stack
Obsidian / Markdown / Vector search
Aspek dibandingkan
4
Batasan terbuka
3
BACA HASILNYA

01 / Pertanyaannya

Metode mana yang lebih cocok untuk knowledge base: sistem RAG, atau ide LLM Wiki Markdown yang dipakai lewat Obsidian?

Kedua metode berakhir dengan cara yang sama: model membaca sebagian teks lalu menjawab. Bedanya ada pada siapa yang menentukan teks mana yang dibaca. RAG menentukannya lewat kemiripan saat pertanyaan diajukan. Wiki Markdown menentukannya lewat hubungan yang sudah ditulis seseorang sebelumnya.

Jadi perbandingannya bukan soal penyimpanan. Pertanyaannya: apakah knowledge base lebih terbantu oleh pencarian yang tidak bisa dilihatnya, atau oleh tautan yang bisa dilihatnya.

FIG. — THE QUESTION

02 / Jalannya eksperimen

Ikuti jalannya langkah demi langkah.

Empat langkah, sesuai urutan kejadiannya.

FIG. 0102 / JALANNYA EKSPERIMEN

02 / Jalannya eksperimen / langkah 01 dari 04

Tulis pengetahuannya sekali.

Catatan yang sama, ditulis manual, dalam Markdown biasa. Tidak ada yang di-generate, jadi kedua jalur berangkat dari materi yang identik dan perbedaan apa pun berasal dari metodenya, bukan isinya.

03 / Pendekatannya

Dua versi, satu pertanyaan.

Beralih di antara keduanya. Susunan dan urutannya sama, jadi yang berbeda hanya isinya.

FIG. — INDEKS RAG

RAG dengan vector search

Catatan dipecah, dibuat embedding-nya, dan disimpan sebagai vektor. Setiap pertanyaan mengambil beberapa chunk terdekatnya sendiri, jadi model hanya melihat bagian knowledge base yang tampak relevan.

  • Context disusun per pertanyaan, tidak dibaca utuh.
  • Relevansi ditentukan oleh kemiripan, bukan oleh penulis.
  • Skalanya mengikuti indeks, bukan jumlah bacaan.
  • Chunking, embedding, dan pencarian semantik masing-masing perlu disetel dengan benar.

04 / Hasilnya

Satu per satu, per aspek.

Pilih sebuah baris untuk membaca kenapa hasilnya begitu.

Indeks RAG — jelas

Efisiensi token

RAG mendapat context yang lebih tepat sasaran dengan anggaran yang sama. Wiki harus membaca indeks Markdown yang besar sebelum sampai ke catatan yang benar-benar menjawab pertanyaan, dan indeks itu ikut memakan context.

Empat aspek, dinilai secara kualitatif di kedua versi. Belum ada angka benchmark yang boleh dipublikasikan.

05 / Untung-rugi

Tidak ada yang gratis.

Harga dari setiap keuntungan, di baris yang sama dengan keuntungannya.

  1. Yang didapat

    Vector search menjaga context tetap kecil dan pencarian tetap cepat, dan terus bekerja saat knowledge base bertambah besar.

    Harga yang dibayar

    Pencarian menjadi sistem kedua yang harus dibuat benar. Chunking, embedding, dan pencarian semantik punya cara gagalnya masing-masing, dan tidak ada yang terlihat dari jawabannya.

  2. Yang didapat

    Hubungan yang ditulis manual membuat rute ke jawaban bisa ditebak, dan rute yang salah bisa dilihat lalu diperbaiki.

    Harga yang dibayar

    Setiap level indeks harus dibaca sebelum catatan di bawahnya, dan file indeks itu terus tumbuh bersama pengetahuannya sampai menjadi bagian yang paling mahal.

  3. Yang didapat

    Markdown biasa tetap mudah dibaca dan diedit oleh penulisnya, tanpa langkah build di antara suntingan dan jawaban berikutnya.

    Harga yang dibayar

    Keterbacaan itu dijaga secara manual. Tidak ada yang menjaga hubungannya tetap benar begitu knowledge base melewati ukuran yang bisa dipegang satu orang.

06 / Masih terbuka

Yang belum terpecahkan.

3 batasan yang belum dijawab eksperimen ini.

  1. Perbandingannya dinilai secara kualitatif. Belum ada angka benchmark yang boleh dipublikasikan.

  2. Baru diuji sampai knowledge base kecil-menengah yang ditulis sendiri. Titik ketika pendekatan Markdown tidak lagi menjadi pilihan yang lebih baik belum diukur.

  3. Versi hibrida — hubungan yang ditulis manual dengan vector search di bawahnya — belum dibuat, jadi opsi ketiga yang paling jelas ini belum diuji.

FIG. — STILL OPEN

Kesimpulan sementara

RAG unggul dalam efisiensi token dan kecepatan, dan keunggulan itu makin lebar seiring knowledge base membesar. LLM Wiki Markdown unggul dalam kemudahan perawatan dan keterprediksian. Untuk knowledge base kecil sampai menengah yang kamu tulis sendiri, pendekatan Markdown lebih efektif di antara keduanya: hubungannya eksplisit, jadi kamu bisa memperkirakan apa yang akan dibaca model.

Catatan proses

  • RAG unggul dalam efisiensi token dan kecepatan; wiki Markdown unggul dalam kemudahan perawatan dan keterprediksian.
  • Untuk knowledge base kecil sampai menengah yang ditulis sendiri, wiki lebih efektif di antara keduanya.
  • Belum ada angka benchmark yang boleh dipublikasikan, jadi perbandingannya dijelaskan secara kualitatif.

Memuat isnan lab…

Loading

Still loading. The connection may be slow. This page could not load. Check the connection and reload.