Skip to main content
AI dalam Pendidikan19 menit membaca

Tutor yang Mengingat: Memori Mata Pelajaran yang Bertahan Melampaui Jendela Konteks

Seorang siswa berbicara tentang satu mata pelajaran selama berbulan-bulan. Memasukkan lebih banyak hal itu ke dalam prompt tidak dapat berskala dan tidak membuat tutor lebih jujur. Begini cara kami membangun sebuah memori yang mengurutkan masa lalu berdasarkan relevansi, sebuah peta konsep dari materi, dan keyakinan tentang siswa yang membawa buktinya sendiri: dua belas diagram, contoh nyata, dan apa yang diajarkan kepada kami saat memutar ulang riwayat nyata.

iTutor Team18 September 2026

Seorang siswa berbicara tentang satu mata pelajaran selama berbulan-bulan: ribuan pesan, puluhan berkas, ratusan cek kecil. Memasukkan lebih banyak hal itu ke dalam prompt tidak dapat berskala dan tidak membuat tutor lebih jujur. Berikut cara kami memberi setiap mata pelajaran sebuah memori yang mengurutkan masa lalu berdasarkan relevansi, sebuah peta konsep dari materinya, dan keyakinan tentang siswa yang membawa buktinya sendiri, serta apa yang diajarkan riwayat nyata kepada kami saat kami memutarnya ulang. Nama vendor sengaja tidak disebutkan; metode ini tidak bergantung pada mereka. Setiap angka di sini diukur, bukan diperkirakan.

Apa yang harus dimaksud dengan "mengingat"

Jawaban naif untuk "tutornya lupa" adalah jendela yang lebih besar: simpan lebih banyak percakapan di dalam prompt, ringkas sisanya. Cara ini gagal dalam tiga hal yang berbeda, dan masing-masing adalah masalah produk sebelum menjadi masalah teknis.

  • Waktu. Siswa yang bertanya pada bulan September tentang sesuatu yang dibahas pada bulan Juli membutuhkan sesi Juli itu, bukan empat puluh pesan terakhir. Ringkasan "apa yang telah terjadi sejauh ini" makin kabur seiring bertambah panjang; detail yang relevan justru yang paling sering dibuang oleh ringkasan.
  • Berkas. Satu mata pelajaran memuat puluhan dokumen. Pengambilan mengambil delapan bagian teks yang paling dekat dengan pertanyaan, yang cukup baik untuk fakta tetapi tidak berguna untuk "bagaimana bab ini berhubungan dengan bab itu", struktur materi tidak pernah ada dalam satu bagian teks saja.
  • Kejujuran. Tutor yang melaporkan "Anda memahami osmosis" harus bisa menjelaskan alasannya: cek yang mana, pada hari apa, apa jawaban siswa. Angka tanpa bukti hanyalah tebakan berdesimal.

Karena itu kami menetapkan tiga komitmen sebelum menulis satu baris kode pun: setiap giliran menjadi sebuah episode yang tahan lama dan pengingatan mengurutkan seluruh riwayat berdasarkan relevansi, bukan tanggal; konsep diekstraksi sekali per berkas dan digabungkan menjadi satu peta konsep per mata pelajaran; dan penguasaan hanya dipasok oleh bukti, sebuah cek yang dijawab, sebuah kuis yang diambil, satu ronde yang dimainkan, dengan setiap keyakinan menyimpan bukti dan riwayatnya sendiri. Dan komitmen keempat yang lebih diam-diam: ketika tutor tidak memiliki memori tentang sesuatu, ia mengatakannya, dengan terang-terangan.

Bentuk sistem ini

Tiga penyimpanan, satu pembacaan beranggaran per giliran, satu siklus setiap malam. File mengisi peta; percakapan mengisi log episode; cek mengisi keyakinan. Setiap giliran obrolan membaca sepotong kecil dan terurut dari ketiganya lalu memasukkannya ke dalam prompt di dalam anggaran token yang tetap. Tidak ada apa pun pada jalur pembacaan yang memanggil model generatif. Satu-satunya model yang dipanggilnya adalah embedding, sekali per giliran, digunakan bersama oleh perutean dan pengingatan; satu-satunya proses generatif di luar obrolan adalah yang membaca berkas baru ke dalam peta.

File dibaca 1x per file Percakapan tanya, jawab Cek hasil atas jawaban Peta konsep node, edge, kesiapan Log episode tambah-saja, rantai-hash Log keyakinan diganti, tak pernah diedit ekstrak + gabung dua episode jadi keyakinan 1 giliran, ~2,000 token 1 arahkan pertanyaan → konsep 2 ringkasan: peta, fokus dulu 3 keyakinan pada konsep itu 4 episode yang mirip ini Slot memori prompt sebelum bagian materi Malam · ringkas hari · luruhkan keyakinan basi · kalibrasi · verifikasi rujukan · segarkan model diri balik ke penyimpanan
Gambar 1. Tiga penyimpanan yang diisi oleh tiga jenis peristiwa, satu pembacaan beranggaran per giliran, satu siklus setiap malam. Jalur pembacaan hanyalah pencarian data, aritmetika, dan satu embedding dari pertanyaan itu; satu-satunya pemanggilan generatif di luar obrolan adalah yang membaca berkas baru.

Episode: log tambah-saja yang dirantai hash

Setiap peristiwa menjadi sebuah episode: sebuah pertanyaan, sebuah jawaban, sebuah cek dengan hasilnya, hasil kuis, kedatangan sebuah berkas, atau sesuatu yang secara eksplisit diajarkan siswa kepada tutor. Sebuah episode membawa ringkasan satu baris, teks lengkapnya, konsep-konsep yang disentuhnya, skor salience yang ditetapkan pada saat penulisan, dan bukti-nya, untuk sebuah jawaban, berkas dan halaman yang dirujuknya, dicap dengan sidik jari berkas itu pada saat itu. Episode tidak pernah diedit. Setiap episode menyimpan hash dari episode sebelumnya dalam rantai yang sama, sehingga log dapat dihitung ulang dan segala bentuk perusakan, atau penulisan ulang diam-diam oleh migrasi yang bermaksud baik, akan tampak sebagai keretakan. Itu adalah bukti perusakan, bukan pencegahan perusakan: penulisan ulang terdeteksi, tidak pernah dicegah, dan hanya selama rantai itu atau sebuah checkpoint darinya masih disimpan.

tanya · 12 Jul "Bisa kita bahas sel?" sblm ∅ · hash 7e1c… jawab · 12 Jul kutip Bab 2 h.4 · sidik a91f sblm 7e1c… · hash 03bd… cek · 12 Jul benar · prediksi 0.45 sblm 03bd… · hash c4a0… diajar · 18 Sep "disebut pembangkit tenaga" sblm c4a0… · hash 9f27… hash = sha256(hash sebelumnya · rantai · stempel waktu · tipe · ringkasan), rantai ikuti urutan sisip, walau episode diputar ulang tetap simpan tanggal Julinya
Gambar 2. Rantai episode untuk satu siswa dalam satu mata pelajaran. Putar ulang riwayat lama menyimpan waktu asli tiap episode pada catatannya, sementara rantai itu sendiri mengikuti urutan baris ditulis; keduanya dapat dihitung ulang.

Salience ditentukan oleh jenis episode itu, bukan oleh suasana hati: sebuah cek yang terlewat (0.7) lebih penting daripada yang lolos (0.6), dan sesuatu yang diajarkan siswa kepada tutor (0.85) paling penting, karena itulah satu-satunya memori yang secara eksplisit diminta seseorang untuk disimpan. Sebuah pertanyaan hanya bernilai sederhana 0.35, pertanyaan siswa sendiri adalah pengingatan yang benar tetapi pengingat yang tidak berguna, yang ternyata penting bagi jalur "apa yang ini mengingatkan saya" nanti.

Pengingatan: relevansi harus mengalahkan kebaruan

Pengingatan bersifat asosiatif, bukan kronologis. Kandidat dikumpulkan dari beberapa kumpulan, masing-masing menjangkau seluruh riwayat, dan baru kemudian diberi skor: lima ratus yang paling baru, setiap episode yang memuat kata khas dari pertanyaan, setiap episode yang menyentuh konsep tempat pertanyaan itu dirutekan, dan tetangga semantik dari indeks vektor. Melebarkan dahulu lalu memotong belakangan adalah keputusan desain tunggal paling penting dalam modul ini, draf pertama memotong dahulu ("500 yang terbaru") dan tidak bisa mengingat memori yang sangat relevan dari bulan Maret pada relevansi berapa pun, karena memori itu sudah terpotong sebelum diberi skor.

−0.1800.250.500.75 relevansi: 0.55, kosinus jika diembedding, tumpang-tindih leksikal jika tidak relevansi0.55 tumpang-tindih konsep: +0.20 saat episode menyentuh konsep tempat pertanyaan dirutekan tumpang konsep+0.20 kebaruan: 0.15 dengan pelemahan eksponensial, konstanta waktu 30 hari kebaruan (τ = 30 d)0.15 salience: 0.12, ditetapkan oleh jenis episode saat penulisan salience0.12 frekuensi: 0.08, seberapa sering konsep episode itu muncul lagi dalam kumpulan kandidat frekuensi0.08 gaung-diri: −0.18 untuk jawaban tutor sendiri, −0.08 jika jawaban itu merujuk sebuah berkas gaung-diri (jawaban tutor) −0.18 · −0.08 jika merujuk berkas bagian solid selalu berlaku; bagian lebih terang penalti tambahan saat jawaban tak merujuk berkas
Gambar 3. Bobot penilaiannya. Relevansi mendominasi; sisanya memodulasi. Jawaban-jawaban masa lalu tutor sendiri diperlemah supaya ia bernalar dari apa yang terjadi, bukan dari apa yang ia katakan, lebih longgar saat jawaban itu berlandaskan berkas siswa, karena jawaban itu adalah catatan tentang apa yang telah diajarkan.

Bobot saja tidak cukup. Ketika pertanyaan tentang sesuatu dan ada yang cocok, episode yang tidak cocok sama sekali dibuang, bukan sekadar diberi peringkat rendah, sebuah catatan segar yang tidak relevan mendapat skor 0.15 × 1.0 hanya dari kebaruan, sementara kecocokan persis berusia 200 hari mendapat skor 0.55 × 0.156, dan tidak ada pembobotan yang membuat yang tidak cocok mengungguli yang cocok bisa dibenarkan pada setelan apa pun. Kebaruan adalah pemutus seri, bukan pemberi peringkat. Ada dua pertanyaan yang sebaiknya diajukan pembaca tentang angka-angka itu: dari mana asalnya, dan apakah kami menyesuaikannya dengan data. Angka-angka itu ditetapkan secara manual, diwariskan dari memori kami sebelumnya yang dibangun untuk produk yang berbeda, dan belum disetel dengan data apa pun dalam artikel ini. Tidak ada yang di bawah ini yang disapu atau disesuaikan; satu-satunya perubahan yang kami buat pada pemberian skor berasal dari kegagalan yang bisa kami sebutkan namanya, bukan dari pencarian, dan itu adalah gerbang, bukan bobot. Gerbang ini punya dua pengecualian: tidak ada kueri sama sekali (maka kebaruan adalah satu-satunya yang tersisa), dan tidak ada yang cocok (maka masa lalu terbaru adalah tawaran terbaik yang jujur).

00.250.50 catatan segar tak relevan: relevansi 0 · kebaruan 1.0 → skor 0.15 catatan segar, tak cocok 0.15 (skor baru) kecocokan persis berusia 200 hari: relevansi 0.53 · kebaruan 0.001 → skor 0.29 kecocokan persis 200 hari 0.29 (relevansi) gerbang membuang baris pertama sepenuhnya saat baris kedua ada skor = 0.55·relevansi + 0.15·kebaruan + 0.08·frekuensi + 0.12·salience + 0.20·konsep − gaung
Gambar 4. Mengapa relevansi menjadi gerbang, bukan sekadar berkontribusi. Blok tempat sebuah episode yang teringat mendarat berjudul "apa yang Anda ingat"; episode yang tak terkait di sana akan dibaca sebagai konteks yang relevan.

Dua hal yang ditambahkan riwayat nyata

Pengulangan menyatu. Pada satu mata pelajaran nyata, 161 pertanyaan siswa ternyata hanya 56 kalimat yang berbeda, "apa itu sel" ditanyakan sembilan kali dalam tiga bulan. Sembilan kopi adalah satu memori, teringat sembilan kali lipat, sehingga pengingatan menyatukan episode yang identik dan melaporkan berapa banyak yang diwakili oleh episode yang tersisa. Waktu adalah penyaring, bukan sekadar petunjuk. "Apa yang kita bahas bulan Juli?" diuraikan menjadi sebuah jendela waktu dan pengingatan berjalan di dalamnya terlebih dahulu; jika jendela itu kosong, blok tersebut mengatakannya secara eksplisit (lihat § kejujuran). Nama bulan berfungsi dalam bahasa-bahasa yang digunakan siswa kami untuk menulis, begitu juga "minggu lalu" dan "kemarin".

Peta konsep

Bagian teks menjawab "apa kata berkas ini di sini"; sebuah peta menjawab "dari apa mata pelajaran ini tersusun, dan apa yang membangun di atas apa". Setiap berkas dibaca sekali oleh satu pemrosesan model yang mengembalikan daftar konsep yang terbatas, nama, inti satu kalimat, definisi singkat, konsep-konsep yang dibangunnya dari daftarnya sendiri, halaman-halaman tempat berkas itu menjelaskannya. Judul bagian ("Pendahuluan", "Kesalahpahaman umum") ditolak oleh sebuah validator; sebuah nama yang sebenarnya adalah judul bab adalah perabot berkas itu, bukan gagasan mata pelajaran itu.

Konsep bergabung lintas berkas melalui kunci kanonis (nama yang dinormalisasi, sadar-skrip) dan melalui kemiripan embedding di atas 0.86. Provenansi menumpuk: sebuah bab yang menjelaskan ulang osmosis menambahkan dirinya ke satu node, bukan membuat node kedua, dan setiap berkas yang berkontribusi tetap tercantum dengan halamannya. Sebuah prasyarat yang diasumsikan berkas tetapi tak pernah dijelaskan menjadi node hanya ketika dua konsep mengasumsikannya, maka kesenjangan itu nyata dan layak ditampilkan; kejadian tunggal dicatat pada konsep itu sebagai "diasumsikan" dan tidak digambarkan di mana pun. Dokumen kebijakan pertama yang kami baca mengubah 11 konsep menjadi 34 node sebelum aturan itu ada.

Sel eukariotik Membran Sitoplasmatersentral Dinding Nukleus Kloroplas Mitokondriasulit · jadwal Ribosom Endosimbiosis berbasis terkait dipahami masih belajar kesulitan belum ada bukti perlu diulang besar = makin sentral
Gambar 5. Sepotong peta nyata (biologi sel, satu berkas, 16 konsep). Tanda panah menunjuk dari prasyarat ke apa yang membangun di atasnya; tata letak menempatkan prasyarat di kiri. Kedudukan siswa dilukiskan pada node yang telah dijangkau oleh cek.

Tiga angka turunan muncul dari peta ini. Sentralitas adalah PageRank berbobot atas edge (sebuah prasyarat yang menjadi dasar segalanya adalah sebuah hub). Kesiapan per konsep mengikuti empat pita, 0.35 hanya disebut namanya, 0.60 dijelaskan oleh sebuah berkas, 0.85 dikonfirmasi oleh cek yang lolos, 1.0 diajarkan oleh seseorang, dan kesiapan mata pelajaran itu adalah rata-rata berbobot sentralitas, sehingga sebuah hub yang tidak dijelaskan berkas mana pun berbiaya lebih mahal daripada sebuah daun. Urutan pengajaran adalah pelapisan topologis: prasyarat lebih dulu, hub lebih dulu di dalam satu lapisan; ini menggantikan pemanggilan model yang dulu menyusun garis besar "apa yang harus diajarkan" dari empat belas bagian teks.

Contoh · sebuah peta mata pelajaran yang dirender untuk prompt (≤ 700 token, konsep fokus lebih dulu)
SUBJECT MAP (16 concepts; the files explain 79% of it, this is about the material, NOT the student's mastery):
- Mitochondria: Mitochondria release energy from glucose. [taught: in our class we call the mitochondria the powerhouse of the cell] (builds on: Cytoplasm)
- Cytoplasm: Cytoplasm is the gel-like substance inside the cell membrane. (builds on: Cell Membrane)
- Chloroplasts: Chloroplasts are involved in photosynthesis. (builds on: Cell Wall)
- Endosymbiosis: Endosymbiosis explains the origin of mitochondria and chloroplasts. (builds on: Mitochondria, Chloroplasts)
…

Susunan kata pada header itu sendiri adalah sebuah pelajaran. Versi pertama berkata "79% dipahami", dan sebuah model yang membacanya dengan senang hati berkata kepada seorang siswa "mengingat pemahaman Anda saat ini sebesar 79%…". Sebuah angka kesiapan yang bisa dibaca sebagai penguasaan siswa akan dibaca seperti itu; baris itu sekarang mengatakan apa sebenarnya angka itu tentang.

Mengajari mata pelajaran itu

Seseorang bisa menambah ke peta itu dengan berbicara padanya. "Ingat bahwa di kelas kami, kami menyebut mitokondria sebagai pembangkit tenaga sel" melekatkan sebuah catatan ajaran ke konsep yang disebutnya (dirutekan berdasarkan nama; hanya kecocokan persis), menetapkan kesiapan konsep itu ke 1.0, menulis sebuah episode diajarkan, dan memasukkan catatan itu ke dalam ringkasan. Ketika kalimat itu tidak menyebut konsep yang sudah ada, sebuah node baru dicetak pada lapisan ajaran dengan nama singkat, bukan seluruh kalimat itu. Pertanyaan tidak pernah mengajar; hanya "ingat bahwa", "perlakukan X sebagai", atau ungkapan setara dalam bahasa siswa itu yang mengajar.

Keyakinan yang menyimpan riwayatnya

Sebuah keyakinan adalah apa yang saat ini dipikirkan tutor tentang siswa ini pada konsep ini: "kesulitan dengan osmosis", "memahami sitoplasma", dengan sebuah taraf keyakinan dan episode-episode di baliknya. Aturan yang penting: baris tidak pernah diperbarui menjadi klaim yang berbeda. Ketika tutor berubah pikiran, baris lama tetap persis seperti semula, sebuah baris baru disisipkan, dan baris lama itu menunjuk ke baris baru itu. Pengingatan hanya membaca baris yang tidak digantikan apa pun; sebuah laporan bisa menyusuri rantai itu ketika seseorang bertanya apa yang berubah dan mengapa. Retensi dan kekinian adalah dua sifat yang berbeda, dan sebuah memori yang menyimpan keduanya adalah memori yang bisa dijadikan dasar sebuah laporan.

sulit dengan sitoplasma taraf 0.90 · setelah cek salah bukti: cek c4a0 (salah) diganti_oleh → baris 2 (revisi) masih belajar sitoplasma taraf 0.50 · penguasaan 0.45 bukti: c4a0 (salah), d1e2 (benar) diganti_oleh → baris 3 (revisi) memahami sitoplasma taraf 0.72 · penguasaan 0.72 bukti: c4a0, d1e2, e7f8 (benar) terkini, satu-satunya yang dibaca bukti terbawa saat direvisi: kesalahan tetap tercatat walau siswa lalu dinilai memahami
Gambar 6. Tiga baris yang saling terhubung untuk satu konsep. Klaimnya adalah sebuah pita penguasaan (di bawah 0.3 kesulitan, 0.3–0.6 masih belajar, 0.6 ke atas memahami), sehingga rangkaian jawaban benar yang melewati satu pita berarti perubahan pikiran, dicatat, tak pernah ditimpa. Sedikit perubahan taraf di dalam satu pita hanya menegaskan ulang baris yang sama.

Keyakinan itu murah di bagian yang penting: sekitar dua puluh token masing-masing, dan satu keyakinan mewakili puluhan episode. Rasio itu, bukan jendela yang lebih besar, adalah arti sebenarnya dari "mengingat lebih dari yang muat di dalam konteks". Episode tidak dibuang, episode adalah tempat sebuah keyakinan diperiksa, tetapi episode datang belakangan dan pemanggil menghabiskan sisa anggarannya pada mereka.

Sebuah keyakinan itu tentang topik apa?

Inilah bagian yang pertama kali dipatahkan oleh data nyata. Dalam mode ajar, "topik" sebuah cek dulunya adalah kata-kata siswa sendiri, sehingga cek yang diputar ulang menghasilkan keyakinan seperti memahami ajukan saja pertanyaannya (ask me the questions) dan kesulitan dengan bueno ahora explícame todos los pasos. Sekarang topik sebuah cek dirutekan ke sebuah konsep berdasarkan nama, dan ketika string topik itu berupa kalimat, berdasarkan teks evaluasi tutor sendiri (yang biasanya menyebut konsep itu) hanya pada kecocokan nama yang persis. Sebuah topik yang tidak cocok dengan apa pun dan terbaca seperti sebuah ucapan, kata tanya, kata kerja bertanya, kata ganti, kata pengisi, dalam bahasa-bahasa yang digunakan siswa kami, tetap disimpan sebagai bukti tetapi tidak pernah menjadi sebuah keyakinan. Perubahan aturan seperti itu membutuhkan cara untuk menurunkan ulang: pensiunkan keyakinan yang berlaku sekarang (jangan pernah dihapus), putar ulang cek yang tercatat menurut aturan hari ini, jangan sentuh episode apa pun.

Satu giliran, dalam anggaran

Setiap giliran obrolan meminta otak itu untuk satu blok, dibangun di luar jalur permintaan dengan batas waktu keras. Selama 155 giliran, blok itu membutuhkan 295 ms pada median, 403 ms pada persentil ke-90, dan 445 ms pada persentil ke-95, dengan satu kali pembangunan di atas satu detik dan tidak ada yang melewati batas 2.5 s, yang setelahnya bundel dijatuhkan alih-alih ditunggu agar sebuah memori yang lambat tidak pernah menghalangi token pertama. Satu embedding dari pertanyaan itu melayani baik perutean maupun pengingatan. Blok itu masuk ke dalam slot memori yang sudah ada di prompt, sebelum bagian-bagian materi, dan tidak ada hal lain pada prompt yang berubah.

anggaran: 2,000 token · giliran nyata tipikal pakai 720–1,030 ringkasan (peta, fokus dulu): ~380 token peta 380 keyakinan pada konsep yang dipakai: ~100 token (≈ 20 masing-masing) 100 episode yang teringat, dari yang paling lama: ~380 token episode 380 cara memakainya, dan baris tanpa-riwayat saat suatu periode kosong: ~60 token sisa ≈ 1,080 token 01,0002,000 peta, konsep fokus dan tetangganya lebih dulu yakin episode instruksi
Gambar 7. Ke mana token itu pergi. Peta dirender dengan yang relevan lebih dulu di dalam 700 token; keyakinan adalah representasi paling murah dan datang setelahnya; episode mengisi sisanya, dari yang paling lama, karena garis waktu lebih mudah dibaca daripada sebuah peringkat.
Contoh · blok untuk "Apa yang kita bahas bulan Juli tentang sel eukariotik?" (dipersingkat)
===== YOUR MEMORY OF THIS STUDENT AND SUBJECT =====
THE STUDENT IS ASKING ABOUT THEIR OWN RECORD. Answer from the beliefs and the earlier work listed here …
WHAT YOU CURRENTLY BELIEVE ABOUT THIS STUDENT (from their checks; confidence 0–1):
- understands cytoplasm (0.72)
- understands eukaryotic cells (0.72)
EARLIER WORK WITH THIS STUDENT (oldest first):
- 12 Jul · you were asked: Can we go over Eukaryotic Cells today? I keep mixing it up.
- 12 Jul · you answered: Of course. Eukaryotic Cells: Eukaryotic cells contain a nucleus and organelles. We worked through two examples and you got the second one right.
- 18 Sep · the student taught you: Taught: in our class we call the mitochondria the powerhouse of the cell
- 18 Sep · check: Check on cytoplasm: right (and 3 more times like it)
SUBJECT MAP (16 concepts; the files explain 79% of it, …)
…
HOW TO USE THIS: it is your own memory of past work with this student, not their material. When you rely on it, say when it happened ("in July we…"). Never claim a memory that is not listed here. …
===== END OF MEMORY =====

Urutan di dalam blok itu ternyata sama pentingnya dengan isinya. Untuk pertanyaan biasa, peta datang lebih dulu. Untuk sebuah pertanyaan riwayat: "apa yang saya salah sejauh ini", "apa yang sudah kita pelajari", "ماذا أخطأت", keyakinan dan pekerjaan sebelumnya datang lebih dulu dan peta di akhir, dengan sebuah baris pertama yang eksplisit mengatakan bahwa siswa itu bertanya tentang riwayatnya sendiri. Kami mempelajari ini dari sebuah kegagalan: prompt itu juga membawa sebuah bagian warisan "hasil penilaian" yang dimulai dengan "TIDAK ADA PERCOBAAN KUIS yang tercatat", dan model itu menjawab seorang siswa yang telah menjawab dua puluh delapan cek dalam percakapan dengan "Anda belum pernah mencoba kuis apa pun". Sebuah model membaca pernyataan otoritatif pertama tentang sebuah riwayat dan berhenti di sana. Blok memori itu sekarang mendahului bagian itu, sebuah catatan penjembatan mengikat keduanya bersama, dan sebuah bagian penilaian yang hanya berkata "tidak ada yang tercatat" dibuang ketika blok memori itu ada.

Contoh · setelah perbaikan, pertanyaan yang sama pada riwayat nyata

Siswa: Apa yang saya jawab salah pada cek-cek sejauh ini, dan apa yang harus saya pelajari ulang?

Tutor: Apa yang Anda jawab salah pada cek-cek itu: 1. Cek tentang apa itu sel: sebagian benar, Anda menjelaskannya sebagai "seperti benda kecil?", yang tidak lengkap. Jawaban yang salah: Anda menjawab "iya" dan "air" pada kesempatan yang berbeda, yang ditandai salah. 2. Cek tentang enzim: Anda benar menyatakan bahwa enzim adalah "protein yang memecah makanan agar lebih mudah dicerna". Saran revisi: mengingat kesulitan Anda tentang apa itu sel: struktur sel (prokariotik vs eukariotik)… komponen sel… misalnya, mitokondria melepaskan energi dari glukosa, yang Anda pelajari di kelas.

Mengatakan "Saya tidak punya riwayat"

Kegagalan paling mengajarkan dari seluruh proyek ini adalah sebuah skenario yang kami tulis untuk lolos: tanamkan sebuah percakapan Juli, tanyakan "apa yang kita bahas bulan Juli tentang X", periksa jawabannya. Jawabannya dimulai dengan "Pada bulan Juli, kita membahas X…" dan lancar, berlandaskan berkas, dan sama sekali dikarang, memori Juli itu tidak pernah mencapai prompt, dan model itu menarasikan Juli dari kerangka pertanyaannya sendiri. Ada dua sebab. Mode pertanyaan-riwayat hanya menyimpan cek dan kuis serta membuang percakapan yang justru merupakan riwayat itu; dan narasi-narasi tutor sendiri sebelumnya ("Pada bulan Juli kita membahas…", tersimpan sebagai episode jawaban) diingat kembali seolah-olah itu adalah memori Juli, otak itu mengingat bahwa dirinya pernah mengingat.

JunJulAguSepkini "Juli" → jendela · diingat dulu 12 Jul tanya 12 Jul jawab (kutip Bab 2) Juni: kosong 18 Sep "Juli kita bahas…" ditandai riwayat · tak pernah jadi memori jendela kosong menghasilkan satu baris, "ANDA TIDAK PUNYA MEMORI DARI JUNI 2026 DENGAN SISWA INI", dan tak ada yang terbaca sebagai Juni
Gambar 8. Waktu sebagai penyaring. Sebuah pertanyaan tentang suatu periode mengingat di dalam periode itu lebih dulu; narasi-narasi tutor sendiri tentang riwayat itu ditandai saat penulisan dan dikecualikan; sebuah periode yang kosong menghasilkan satu baris eksplisit dan menekan segala hal lain yang bisa disalahartikan sebagai itu, termasuk peta, yang jika tidak akan diringkas oleh model sebagai "seperti yang dibahas pada bulan Juni".
Contoh · skenario itu, sebelum dan sesudah

sebelum "Pada bulan Juni, kita membahas topik Membran Sel, yang dijelaskan sebagai berikut: membran sel adalah lapisan ganda fosfolipid…"

sesudah "Saya tidak memiliki catatan tentang apa yang secara spesifik kita bahas pada bulan Juni mengenai membran sel. Namun, saya dapat memberikan Anda informasi tentang membran sel dari materi yang kita miliki…"

Kedua kasus itu sekarang menjadi skenario dalam sebuah pelaksana yang bisa diulang: skenario Juli lolos hanya jika memori-memori Juli itu ada di dalam prompt (diperiksa berdasarkan id memori yang tersimpan pada pesan itu, bukan berdasarkan kata-kata jawabannya), dan skenario bulan-kosong lolos hanya jika jawabannya mengatakan bahwa ia tidak memiliki catatan dan tidak menggambarkan sebuah sesi.

Memori sebagai rujukan

Obrolan kami sudah memiliki sebuah panel provenansi: setiap klaim dalam sebuah jawaban dilacak ke sebuah baris dalam berkas siswa, dan sebuah jawaban dengan terlalu sedikit klaim yang terlacak ditandai sebagai sebagian besar tanpa landasan. Pelacak itu hanya mengenal berkas. Sebuah "pada bulan Juli kita membahas X, dan Anda benar pada contoh kedua" yang benar karenanya akan terbaca sebagai tidak ada di catatan Anda: fitur itu menyebut pernyataan yang benar sebagai salah. Jadi memori-memori yang diingatkan kembali kepada tutor itu disimpan pada jawabannya, dan pelacak itu memperlakukan setiap episode yang teringat sebagai satu sumber lagi, diberi label dengan kapan hal itu terjadi.

Jawaban, per klaim "Pada cek Anda berkata 'ke arah sisi tawar'" "Osmosis menggerakkan air ke arah garam" "Mitokondria memiliki dua membran" "Ingin menjelajahi ini lebih jauh?" (bukan klaim, dilewati) Karya lalu Anda · 12 Jul "cek osmosis: salah, 'sisi tawar'" Catatan Biologi Sel · hlm. 4 "…ke konsentrasi zat terlarut lebih tinggi…" berlandasan 3/3 · lencana jawaban hitung baris bersandar memori sebagai berlandasan
Gambar 9. Dua jenis sumber dalam satu panel. Sebuah baris yang didukung oleh memori yang teringat diberi label berdasarkan tanggal, bukan halaman, dan peringatan "sebagian besar tanpa landasan" tidak lagi muncul pada sebuah ingatan yang benar.

Hasil landasan yang sama memberi setiap episode jawaban sebuah sikap: terjawab, sebagian, atau tidak bisa, disimpan setelah fakta itu diketahui. Begitulah cara laporan mempelajari pertanyaan mana yang tidak bisa dijawab oleh berkas, tanpa pemanggilan model kedua dan tanpa sebuah baris "bingkai" tersembunyi dalam aliran itu, yang kami coba dan tolak: dalam mode jawaban biasa tidak ada apa pun yang menyaring aliran itu, sehingga sebuah baris tersembunyi akan mencapai siswa.

Memori yang memeriksa dirinya sendiri

Sebuah memori yang tidak bisa memeriksa dirinya sendiri menjadi makin percaya diri dan makin tidak benar seiring usianya. Karena bukti sebuah jawaban mencatat sidik jari berkas pada saat itu, verifikasi adalah sebuah pencarian data, bukan pemanggilan model: bertahan: berkas yang dirujuk masih ada, tak berubah; berubah: berkas itu diganti atau dihapus, dan catatannya mengatakan yang mana; tak terverifikasi: memori itu tidak merujuk berkas apa pun (sebuah percakapan, sebuah cek). Jawaban ketiga itu adalah sebuah hasil kelas satu, bukan sebuah kesalahan; melaporkan sebuah memori percakapan sebagai "bertahan" justru akan menjadi cacat yang sesungguhnya. Sebuah episode yang teringat tiba di prompt sudah diberi label: "[catatan: berkas yang dirujuk ini telah diganti atau dihapus sejak itu]".

utuh rujuk Bab 2 h.4 · sidik a91f berkas kini · sidik a91f "rujukan masih ada dan tak berubah" berubah rujuk Bab 2 h.4 · sidik a91f berkas kini · sidik 5c02 (unggahan baru) 'Bab 2' telah diganti → kesiapan turun nirverifikasi cek, pertanyaan, catatan ajaran tak ada berkas dirujuk jawaban jujur, bukan kegagalan hanya tiga kolom verifikasi ini yang ditulis; bukti dan rantai hash tak pernah disentuh
Gambar 10. Verifikasi terhadap sidik jari berkas. Ketika sebuah berkas dihapus, setiap memori dalam mata pelajaran itu yang merujuknya diperiksa ulang sekaligus, konsep yang dijelaskannya kehilangan provenansi itu, kesiapan turun dan ringkasan itu dirender ulang, dan laporan itu mengatakannya.

Siklus malam

Sekali setiap malam, untuk setiap pasangan siswa-dan-mata pelajaran yang aktif dalam sehari terakhir, sebuah siklus deterministik berjalan tanpa pemanggilan model apa pun: kompres hari itu menjadi satu episode konsolidasi (hitungan per jenis, tally cek, topik-topiknya, lima judul paling salien; hari yang sepi tidak menulis apa pun, dan catatan itu tidak pernah meringkas ulang jenisnya sendiri); luruhkan setiap keyakinan yang tak tersentuh selama 45 hari sebesar 15%, dan tandai untuk dikonfirmasi oleh cek berikutnya; kalibrasi penguasaan yang diprediksi tutor sebelum setiap cek terhadap hasilnya; verifikasi satu batch rujukan yang terbatas, yang belum pernah diperiksa lebih dulu; bangun ulang set kerja kecil; susun ulang model diri.

kompreshari → catatan luruh basi45 h · ×0.85 · tanda kalibrasiprediksi vs hasil sahkan40 rujukan, tertua dulu model diribatas jujur tiap pasangan aktif 26 jam terakhir · tak ada pemanggilan model di siklus ini · tiap pasangan unit kerjanya sendiri
Gambar 11. Siklus konsolidasi ini. Ia berjalan dari sebuah pewaktu terjadwal, satu pasangan pada satu waktu; satu kegagalan dicatat ke log dan penyapuan itu terus berlanjut.

Kalibrasi adalah pemeriksaan kejujuran atas keyakinan diri tutor: sebelum setiap cek kami tahu penguasaan apa yang diprediksinya; setelahnya, kami tahu hasilnya. Dikelompokkan dalam bucket, itu memberi sebuah kurva reliabilitas dan sebuah galat kalibrasi yang diharapkan, dan model diri hanya melaporkan "terkalibrasi" dari lima cek yang memiliki prediksi. Sebelum itu, batasannya mengatakan begitu, perlakukan taraf keyakinan sebagai sebuah peringkat, bukan sebuah probabilitas.

00.51.0 00.51.0 penguasaan diprediksi sebelum cek porsi jawaban benar kalibrasi sempurna (diagonal) bucket 0.0–0.2: prediksi 0.10 · terwujud 0.50 · n = 2 n=2 bucket 0.2–0.4: prediksi 0.30 · terwujud 0.60 · n = 5 n=5 bucket 0.4–0.8: prediksi 0.60 · terwujud 0.80 · n = 5 n=5 bucket 0.8–1.0: prediksi 0.90 · terwujud 1.00 · n = 2 n=2 titik di atas garis: tutor meremehkan siswa ini
Gambar 12. Sebuah kurva reliabilitas dari empat belas cek pada satu mata pelajaran (bucket ilustratif). Selisih antara nilai prediksi dan nilai terwujud sebuah bucket, dibobot oleh ukurannya, adalah galat kalibrasi yang diharapkan yang dilaporkan model diri; di atas 25 poin itu menjadi sebuah batasan yang dinyatakan.

Apa yang diajarkan riwayat nyata kepada kami

Skenario membuktikan mekanisme; skenario tidak membuktikan bahwa hal itu berjalan sesuai cara orang benar-benar berbicara. Jadi kami membangun sebuah putar ulang: ambil riwayat siswa-dan-mata pelajaran nyata paling kaya, hanya-baca, bangun ulang masing-masing dalam salinan platform yang terisolasi, bangun otaknya, dan ajukan tiga pertanyaan berbentuk nyata melalui endpoint obrolan sesungguhnya sebagai pengguna itu. Enam pasangan, 65–142 pesan masing-masing, 13–32 hasil mode-ajar masing-masing, satu dalam bahasa Spanyol. Pasangan-pasangan itu bukan sampel acak dan tidak boleh dibaca sebagai sampel acak. Kami mengambil riwayat dengan setidaknya empat puluh pesan, paling banyak dua per siswa, dengan akun uji dan akun internal dikecualikan, dan mengutamakan riwayat dengan jawaban ternilai terbanyak, karena riwayat yang kosong tidak melatih apa pun. Itu membuat setiap angka di sini bias ke arah pengguna dengan aktivitas tinggi. Mata pelajaran milik pengguna dengan aktivitas rendah akan memberi memori itu lebih sedikit untuk diingat dan lebih sedikit peluang untuk keliru.

9–42 suntuk membaca berkas mata pelajaran ke dalam petanya
15–23 suntuk memutar ulang 33–49 giliran riwayat
700–1,030token memori per giliran
2.0–3.8 shingga token pertama, termasuk memori
5 dari 6"apa yang saya salah" terjawab dari cek nyata
6 dari 6pertanyaan konsep dirutekan ke konsep yang tepat

Ini juga menghasilkan tiga perbaikan yang dijelaskan di atas: keyakinan pada kalimat siswa, riwayat yang dijawab dari peta padahal seharusnya dari riwayat itu sendiri, baris warisan "tidak ada percobaan kuis" yang memimpin jawaban, dan satu konfirmasi yang senang kami lihat: sebuah konsolidasi menandai sebelas memori yang berkas rujukannya sudah tidak ada lagi. Verifikator itu menjalankan tugasnya.

Mata pelajaran (nyata, diputar ulang)PesanCekKonsepKeyakinan setelah diturunkan ulangKesiapan peta
Modul aljabar14232160, setiap topik cek berupa kalimat dan tidak ada evaluasi yang menyebut sebuah konsep; cek-cek itu tetap ada pada riwayat dan laporan mengatakannya0.60
Unit sastra9714103, semua berkunci-konsep0.68
Komputasi & pemecahan masalah912974, semua berkunci-konsep0.60 → 0.81
Biología (Spanyol)8831156 (5 berkunci-konsep), sebagian besar "kesulitan dengan…" setelah rangkaian jawaban salah0.62
Sains rangkap tiga7513162, keduanya berkunci-konsep0.64
Buku kerja agama6518126 (5 berkunci-konsep)0.72

Baris aljabar adalah yang paling jujur. Tiga puluh dua cek dan tidak ada keyakinan, karena tidak satu pun bisa dikaitkan dengan sebuah konsep: siswa itu menjawab soal aritmetika, jawaban-jawaban tutor tidak pernah menyebut konsep-konsep bab itu, dan sebuah ucapan bukanlah sebuah topik. Laporan untuk siswa itu mengatakan "32 cek tercatat, tetapi belum satu pun bisa dikaitkan dengan konsep dalam peta" alih-alih "belum ada cek". Tidak ada yang dikarang, termasuk penguasaannya.

Benchmark, bukan demo

Semua yang telah dibahas di atas hanyalah pengukuran atau contoh: berapa lama prosesnya berjalan, apa yang dihasilkan replay, jawaban yang kami sukai. Tidak satu pun dari itu membuktikan bahwa memori ini layak dipertahankan, karena belum ada perbandingan dengan tutor yang sama tanpa memori. Karena itu kami menjalankan perbandingan tersebut. Satu set pertanyaan yang didaftarkan lebih dahulu, empat desain dari tutor yang sama yang hanya berbeda pada apa yang masuk ke prompt, dan penilai berupa perbandingan string dan id, bukan opini, sehingga jawaban yang sama selalu dinilai dengan cara yang sama.

Pertanyaan dibuat per mata pelajaran dari data riwayat mata pelajaran itu sendiri, dan itulah yang membuatnya bisa dinilai: pertanyaan tentang apa yang dijawab salah oleh siswa diperiksa terhadap cek yang benar-benar tercatat, pertanyaan tentang prasyarat diperiksa terhadap hubungan nyata dalam peta konsep, pertanyaan tentang suatu bulan diperiksa terhadap bulan-bulan saat mata pelajaran itu benar-benar aktif. Jika suatu mata pelajaran mendukung lebih dari satu, maka dibuat lebih dari satu, sehingga tiga konsep dan tiga bulan kosong, bukan hanya satu dari masing-masing. Enam kategori, 420 pertanyaan yang dinilai per desain, pada 45 riwayat siswa nyata yang diputar ulang dalam salinan platform yang terisolasi dan diajukan melalui endpoint obrolan biasa sebagai siswa tersebut.

Keempat Desain

Keempatnya menjalankan retrieval yang sama pada berkas yang sama. retrieval biasa adalah tutor tanpa memori sama sekali. Jendela adalah jawaban yang paling sering dipikirkan orang lebih dulu: dua puluh giliran percakapan terakhir, dimasukkan begitu saja tanpa diurutkan. Episode adalah recall terurut dari log episode saja, tanpa peta konsep, tanpa keyakinan, dan tanpa penanganan khusus untuk pertanyaan riwayat. memori penuh adalah semua yang dibahas artikel ini.

apa yang saya jawab salah, 32 pertanyaan: retrieval biasa 3, jendela 5, episode 24, memori penuh 30 yang saya jawab salah n = 32 30 apa yang telah kita pelajari, 42 pertanyaan: retrieval biasa 28, jendela 31, episode 31, memori penuh 37 yang telah dipelajari n = 42 37 menjelaskan konsep, 124 pertanyaan: retrieval biasa 66, jendela 95, episode 100, memori penuh 100 menjelaskan konsep n = 124 100 apa yang harus direvisi dulu, 46 pertanyaan: retrieval biasa 26, jendela 25, episode 25, memori penuh 44 harus direvisi dulu n = 46 44 bulan dengan aktivitas, 44 pertanyaan: semua desain 44 dari 44 bulan dengan aktivitas n = 44, keempat 44 bulan tanpa apa pun, 132 pertanyaan: retrieval biasa 1, jendela 73, episode 126, memori penuh 128 bulan tanpa apa pun n = 132 1 128 025% 50%75% 100% retrieval biasa jendela 20 episode terurut memori penuh
Gambar 13. Empat desain, pertanyaan yang sama, 45 mata pelajaran yang sama, masing-masing 420 pertanyaan yang dinilai. Total: 168, 273, 350, dan 383. Memori ini layak dipertahankan, begitu pula setiap bagiannya, tetapi tidak merata dan tidak di semua tempat.

Apa kata tabel ini

Secara keseluruhan, tutor ini meningkat dari 168 dari 420 menjadi 383, yaitu 40 persen berbanding 91. Rata-rata adalah angka yang paling tidak menarik di sini; bentuk perbedaannya itulah temuannya.

Jendela lebih besar bukan jawabannya. Memasukkan dua puluh giliran percakapan terakhir ke dalam prompt menaikkan angka dari 40 persen menjadi 65, dan itulah seluruh manfaat yang diberikannya. Cara ini hanya menjawab benar 5 dari 32 pertanyaan tentang apa yang dijawab salah oleh siswa, karena dua puluh giliran obrolan bukan tempat informasi itu berada, dan cara ini masih lebih sering salah daripada benar soal bulan kosong. Inilah jawaban "tinggal masukkan lebih banyak percakapan", diukur, bukan sekadar diasumsikan.

Recall terurut berperan paling besar. Log episode saja sudah mencapai 83 persen. Jika Anda hanya membangun satu hal, bangunlah itu: log yang hanya bisa ditambahkan (append-only), dinilai berdasarkan relevansi, adalah sebagian besar nilai dari artikel ini.

Peta konsep dan keyakinan berkontribusi pada 33 pertanyaan sisanya, dan itu diperoleh di dua tempat tertentu, bukan di semua tempat. Ketika ditanya apa yang harus direvisi sebelum suatu topik, desain tanpa peta konsep menjawab benar sekitar 55 persen dan memori penuh 96 persen, karena prasyarat adalah hubungan dan log episode tidak memilikinya. Ketika ditanya apa yang dijawab salah oleh siswa, keyakinan dan cabang riwayat meningkatkan hasil dari 24 dari 32 menjadi 30. Ketika diminta menjelaskan konsep, peta konsep sama sekali tidak menambah apa pun: 100 baik dengan maupun tanpa itu.

Dua titik ekstrem, pertanyaan sama

retrieval biasa, bulan tanpa aktivitas 1 benar dari 132. Ketika ditanya apa yang dibahas pada bulan saat siswa tidak pernah aktif, tutor ini tetap mendeskripsikan materi dan mengaitkannya dengan bulan tersebut, hampir setiap saat.

memori penuh, pertanyaan sama 128 dari 132. Tutor ini menyatakan tidak memiliki riwayat untuk periode tersebut dan menawarkan apa yang memang dimilikinya.

Biaya untuk mendapatkan itu

+0.36 smedian waktu ke token pertama, 1.62 s hingga 1.98 s
750median token memori yang ditambahkan ke prompt
+51 ptstotal, 40 persen jadi 91
10%dari jawaban yang mendapat nilai berbeda saat ditanya ulang

Yang tidak ditunjukkan benchmark ini

Angka terakhir itulah yang perlu diingat saat membaca sisanya. Kami mengajukan 420 pertanyaan yang identik kepada memori penuh untuk kedua kalinya, dan 44 di antaranya mendapat nilai berbeda. Jadi noise antar-run sekitar sepersepuluh, selisih 33 pertanyaan antara dua desain teratas jelas berada di luar rentang itu, sedangkan selisih 2 pertanyaan di antara keduanya pada kategori bulan kosong tidak: pada kategori itu keduanya seri dan kami tidak akan mengklaim sebaliknya.

Satu kategori ternyata tidak berguna, dan kami membiarkannya tetap ada di diagram, bukan diam-diam menghapusnya. Bulan saat siswa pun aktif mendapat skor 44 dari 44 untuk setiap desain, termasuk yang sama sekali tidak memiliki memori. Desain ini tidak bisa membedakan recall yang berlandaskan data dari deskripsi masuk akal yang kebetulan menyebut bulan yang tepat, dan itu justru kegagalan yang ditangkap oleh kategori pasangannya. Uji yang selalu lolos tidak mengukur apa pun.

Penilai berupa perbandingan string yang ditulis oleh orang yang sama yang membangun fitur ini. Penilai ini memberi nilai tinggi pada jawaban yang menggunakan ulang kata-kata yang tercatat dan tidak bisa mengenali jawaban benar yang disusun dengan kata-kata yang sama sekali berbeda, dan hal ini pernah sangat merugikan kami: pertanyaan prasyarat dibuat dengan arah hubungan yang terbalik, sehingga untuk waktu yang lama kategori ini tampak sebagai yang terlemah dari memori, padahal tutor sebenarnya memberikan jawaban yang sama seperti peta konsep dan malah dinilai salah karenanya. Ini justru kategori terkuat dari peta konsep. Kami menemukan hal ini dengan membaca kegagalan-kegagalannya, bukan totalnya, dan itulah satu-satunya cara kesalahan semacam ini bisa terlihat.

Dan populasinya tidak acak. Ini adalah 45 riwayat siswa nyata yang dipilih karena memiliki sesuatu di dalamnya: setidaknya lima belas pesan, berkas yang dilampirkan, dan untuk kategori yang membutuhkan jawaban bernilai, setidaknya lima di antaranya. Siswa yang baru saja mulai akan jauh lebih jarang memicu hal ini, dan akan melihat perbedaan yang jauh lebih kecil.

Bukan Ini

Empat hal yang sering disalahartikan sebagai ini, dan apa sebenarnya ini.

  • Bukan jendela konteks yang lebih besar. Biaya per giliran dibatasi dan tidak bertambah seiring riwayat yang makin panjang. Benchmark ini memberi angka pasti pada perbedaan tersebut: jendela naif menjawab benar 65 persen dari 420 pertanyaan, sedangkan memori menjawab 91 persen.
  • Bukan peringkasan. Tidak ada yang ditulis ulang. Episode bersifat tak dapat diubah (immutable), koreksi adalah baris baru yang menunjuk ke baris lama, dan keyakinan bulan Maret tetap dapat dibaca setelah digantikan oleh keyakinan bulan Agustus.
  • Bukan pencarian vektor pada log obrolan. Indeks vektor hanyalah satu dari empat kumpulan, dan pemeringkatan mensyaratkan relevansi lebih dahulu sebelum kebaruan, tingkat kepentingan, atau frekuensi ikut berbicara.
  • Bukan profil siswa yang ditulis oleh model. Tidak ada pemindaian riwayat yang menghasilkan deskripsi tentang pembelajar. Setiap keyakinan adalah sebuah rentang yang dihitung dari jawaban ternilai, dengan id bukti yang dilampirkan dan rantai penggantian di baliknya.

Yang sebenarnya: sebuah pembacaan terbatas atas log yang tak dapat diubah, sebuah graf materi yang diekstraksi sekali per berkas, dan keyakinan yang membawa buktinya sendiri.

Prinsip yang kami pegang

  • Tidak ada yang dikarang. Penguasaan hanya datang dari cek, kuis dan ronde; sebuah konsep ada hanya karena sebuah berkas menjelaskannya atau seseorang mengajarkannya; sebuah periode kosong mengatakan begitu.
  • Bukti atau itu tidak terjadi. Setiap keyakinan, setiap baris laporan, setiap kesenjangan membawa id dari apa yang menjadi dasarnya, dan panel rujukan menampilkan memori di samping halaman.
  • Retensi bukan kekinian. Simpan keyakinan Maret itu selamanya; jangan pernah berlandaskan padanya begitu Agustus menggantikannya. Sebuah koreksi adalah sebuah baris baru dengan sebuah tautan, tak pernah sebuah suntingan.
  • Relevansi mengalahkan kebaruan. Lebarkan sebelum memotong; jadikan gerbang, jangan hanya bobot.
  • Narasi tutor sendiri bukanlah memori. Sebuah jawaban yang menceritakan ulang riwayat ditandai saat penulisan dan tidak pernah diingat kembali sebagai memori mata pelajaran itu.
  • Urutan adalah konten. Sebuah model membaca pernyataan otoritatif pertama tentang sebuah riwayat dan berhenti di sana; tempatkan riwayat sebelum apa pun yang bisa disalahartikan sebagai itu.
  • Sebuah ucapan adalah bukti, tak pernah sebuah topik. "Ajukan saja pertanyaannya" bisa benar atau salah; tidak seorang pun memahaminya.
  • Sebuah memori harus bisa memeriksa dirinya sendiri. Catat sidik jarinya pada saat itu; verifikasi lewat pencarian data; perlakukan "tak terverifikasi" sebagai sebuah jawaban.

Semua ini hanya beberapa ribu baris, sebagian besar biasa saja: sebuah buku besar, sebuah graf, sebuah fungsi penilaian, sebuah perender dengan anggaran, dan sebuah tugas malam. Bagian yang sulit bukan kodenya, melainkan memutuskan, setiap kali model itu mengatakan sesuatu yang lancar dan salah, bahwa perbaikannya ada pada memori, bukan pada nada bicara prompt itu.