Seorang pelajar berbual tentang satu subjek sepanjang beberapa bulan: beribu-ribu mesej, puluhan fail, beratus-ratus semakan kecil. Memasukkan lebih banyak daripada itu ke dalam prompt tidak boleh berskala dan tidak menjadikan tutor lebih jujur. Inilah cara kami memberikan setiap subjek satu memori yang menyusun sejarah lampau mengikut relevans, satu peta konsep bagi bahan pembelajaran, dan kepercayaan tentang pelajar yang membawa buktinya sendiri, serta apa yang diajar oleh sejarah sebenar apabila kami memainkannya semula. Tiada vendor dinamakan dengan sengaja; kaedah ini tidak bergantung kepada mana-mana vendor. Setiap nombor di sini diukur, bukan dianggarkan.
Apa maksud sebenar "mengingati"
Jawapan naif kepada "tutor ini lupa" ialah tetingkap yang lebih besar: kekalkan lebih banyak perbualan dalam prompt, ringkaskan selebihnya. Pendekatan ini gagal dalam tiga cara berasingan, dan setiap satu adalah masalah produk sebelum ia menjadi masalah teknikal.
- Masa. Pelajar yang bertanya pada bulan September tentang sesuatu yang dipelajari pada bulan Julai memerlukan sesi Julai itu, bukan empat puluh mesej terakhir. Ringkasan "apa yang telah berlaku sejauh ini" menjadi semakin kabur apabila ia berkembang; butiran yang relevan justeru adalah butiran yang digugurkan oleh ringkasan.
- Fail. Satu subjek menyimpan puluhan dokumen. Pengambilan (retrieval) mendapatkan lapan petikan yang paling hampir dengan soalan, yang memadai untuk fakta tetapi tidak berguna untuk "bagaimana bab ini berkait dengan bab itu", struktur bahan pembelajaran tidak pernah wujud dalam mana-mana satu petikan.
- Kejujuran. Tutor yang melaporkan "anda faham osmosis" mesti dapat menyatakan sebabnya: semakan yang mana, pada hari yang mana, apa yang dijawab oleh pelajar. Nombor tanpa bukti hanyalah tekaan berperpuluhan.
Justeru kami menetapkan tiga janji sebelum menulis sebarang baris kod: setiap pusingan menjadi satu episod kekal dan ingatan semula menyusun keseluruhan sejarah mengikut relevans, bukan tarikh; konsep diekstrak sekali untuk setiap fail dan digabungkan menjadi satu peta bagi setiap subjek; dan penguasaan hanya disokong oleh bukti, satu semakan yang dijawab, satu kuiz yang diambil, satu pusingan yang dimainkan, dengan setiap kepercayaan mengekalkan bukti dan sejarahnya. Dan satu janji keempat yang lebih senyap: apabila tutor tidak mempunyai memori tentang sesuatu, ia menyatakannya secara jelas.
Bentuk sistem ini
Tiga stor, satu bacaan berbajet setiap pusingan, satu gelung pada waktu malam. Fail memberi input kepada peta; perbualan memberi input kepada log episod; semakan memberi input kepada kepercayaan. Setiap pusingan sembang membaca satu bahagian kecil terpilih daripada ketiga-tiganya dan memasukkannya ke dalam prompt dalam bajet token yang tetap. Tidak satu pun dalam laluan bacaan ini memanggil model generatif. Satu-satunya model yang dipanggilnya ialah embedding, sekali setiap pusingan, dikongsi oleh penghalaan dan ingatan semula; satu-satunya laluan generatif di luar sembang ialah yang membaca fail baharu ke dalam peta.
Episod: log hanya-tambah, berangkai cincang
Setiap acara menjadi satu episod: satu soalan, satu jawapan, satu semakan dengan keputusannya, satu keputusan kuiz, satu fail yang tiba, sesuatu yang pelajar ajar secara eksplisit kepada tutor. Satu episod membawa satu ringkasan sebaris, teks penuh, konsep yang disentuhnya, satu skor ketonjolan yang ditetapkan semasa ditulis, dan buktinya: bagi satu jawapan, fail dan halaman yang dirujuknya, dicap dengan cap jari fail itu pada masa tersebut. Episod tidak pernah disunting. Setiap satu menyimpan nilai cincang episod sebelumnya dalam rantaian yang sama, jadi log ini boleh dikira semula dan sebarang gangguan, atau sebarang penulisan semula senyap oleh satu migrasi yang bermaksud baik, akan terserlah sebagai satu putusan. Itu bukti gangguan, bukan kalis gangguan: satu penulisan semula dikesan, bukan dihalang, dan itu pun hanya selagi rantaian itu, atau satu checkpoint daripadanya, disimpan.
Ketonjolan ditetapkan oleh apa jenis episod itu, bukan oleh mood: satu semakan yang gagal (0.7) lebih penting daripada satu yang lulus (0.6), dan sesuatu yang diajar oleh pelajar kepada tutor (0.85) paling penting, kerana ia satu-satunya memori yang seseorang telah minta secara eksplisit untuk disimpan. Satu soalan hanya bernilai sederhana 0.35, soalan pelajar sendiri adalah satu ingatan semula yang betul tetapi satu peringatan yang tidak berguna, dan ini rupanya penting bagi laluan "apa yang diingatkan oleh ini" kemudian.
Ingatan semula: relevans mesti mengatasi kebaruan
Ingatan semula adalah asosiatif, bukan kronologi. Calon dikumpul daripada beberapa kumpulan, setiap satu meliputi keseluruhan sejarah, dan hanya kemudian diberi skor: lima ratus yang paling baharu, setiap episod yang mengandungi satu perkataan tersendiri daripada soalan, setiap episod yang menyentuh konsep yang dihalakan oleh soalan itu, dan jiran semantik daripada satu indeks vektor. Melebarkan dahulu dan memotong kemudian adalah keputusan reka bentuk paling penting dalam modul ini, draf pertama memotong dahulu ("500 yang terbaharu") dan tidak dapat mengimbas kembali satu memori dari bulan Mac yang amat relevan pada mana-mana tahap relevans, kerana ia telah dipotong sebelum diberi skor.
Pemberat semata-mata tidak mencukupi. Apabila soalan itu tentang sesuatu dan ada padanan, episod yang tidak berpadanan langsung digugurkan bukan sekadar diberi kedudukan rendah, satu nota baharu yang tidak relevan mendapat skor 0.15 × 1.0 daripada kebaruan semata-mata, sementara satu padanan tepat berusia 200 hari mendapat skor 0.55 × 0.156, dan tiada pemberat yang membenarkan bukan-padanan mengatasi satu padanan adalah betul pada mana-mana tetapan. Kebaruan hanyalah pemutus seri, bukan penyusun kedudukan. Dua persoalan yang patut ditanya oleh pembaca tentang angka-angka itu: dari mana asalnya, dan sama ada kami menyelaraskannya. Angka itu ditetapkan secara manual, diwarisi daripada satu memori kami yang lebih awal yang dibina untuk produk yang lain, dan ia tidak pernah diselaraskan berdasarkan mana-mana data dalam artikel ini. Tiada apa-apa di bawah ini yang disapu atau diselaraskan; satu-satunya perubahan yang kami buat pada pemarkahan berpunca daripada satu kegagalan yang dapat kami namakan, bukan daripada satu carian, dan perubahan itu adalah pada get, bukan pada pemberat. Get ini mempunyai dua pengecualian: tiada pertanyaan sama sekali (maka kebaruan itu sahaja yang ada), dan tiada apa yang berpadanan (maka masa lampau terbaharu adalah tawaran terbaik yang jujur).
Dua perkara yang ditambah oleh sejarah sebenar
Ulangan bergabung. Dalam satu subjek sebenar, 161 soalan pelajar hanyalah 56 ayat tersendiri, "apa itu sel" ditanya sembilan kali sepanjang tiga bulan. Sembilan salinan adalah satu memori, yang diingati sembilan kali, jadi ingatan semula menggabungkan episod yang serupa dan melaporkan berapa banyak yang diwakili oleh episod yang tinggal. Masa adalah satu penapis, bukan satu petunjuk. "Apa yang kita pelajari pada bulan Julai?" dihurai menjadi satu tetingkap masa dan ingatan semula beroperasi di dalamnya dahulu; jika tetingkap itu kosong, blok tersebut menyatakannya secara jelas (lihat § kejujuran). Nama bulan berfungsi dalam bahasa yang digunakan oleh pelajar kami untuk menulis, begitu juga "minggu lepas" dan "semalam".
Peta konsep
Petikan menjawab "apa yang dikatakan fail ini di sini"; satu peta menjawab "apa bahan subjek ini, dan apa yang membina atas apa". Setiap fail dibaca sekali oleh satu panggilan model yang mengembalikan satu senarai konsep terhad, nama, intipati satu ayat, satu definisi ringkas, konsep yang dibinanya daripada senarainya sendiri, halaman tempat fail itu menjelaskannya. Tajuk seksyen ("Pengenalan", "Kesalahfahaman biasa") ditolak oleh satu pengesah; satu nama yang sebenarnya satu tajuk bab adalah perabot fail itu, bukan idea subjek tersebut.
Konsep bergabung merentasi fail melalui satu kunci kanonik (satu nama yang dinormalkan, sedar-skrip) dan melalui persamaan embedding di atas 0.86. Asal-usul bertambah: satu bab yang menjelaskan semula osmosis menambah dirinya kepada satu nod sedia ada berbanding mencipta nod kedua, dan setiap fail yang menyumbang kekal tersenarai dengan halamannya. Satu prasyarat yang diandaikan oleh fail tetapi tidak pernah dijelaskan hanya menjadi satu nod apabila dua konsep mengandaikannya, barulah jurang itu nyata dan berbaloi ditunjukkan; satu kes tunggal direkodkan pada konsep itu sebagai "andaian" dan tidak dilukis di mana-mana. Dokumen polisi pertama yang kami baca menukar 11 konsep kepada 34 nod sebelum peraturan itu wujud.
Tiga nombor terbitan datang daripada peta ini. Kesentralan ialah satu PageRank berpemberat atas tepi (satu prasyarat yang menjadi asas segalanya adalah satu hab). Kesediaan bagi setiap konsep mengikut empat jalur, 0.35 hanya dinamakan, 0.60 dijelaskan oleh satu fail, 0.85 disahkan oleh satu semakan yang lulus, 1.0 diajar oleh seseorang, dan kesediaan subjek itu ialah min berpemberat-kesentralan, jadi satu hab yang tidak dijelaskan oleh fail lebih mahal daripada satu daun. Susunan pengajaran ialah satu penyusunan topologi berlapis: prasyarat dahulu, hab dahulu dalam setiap tingkat; ia menggantikan satu panggilan model yang dahulu merangka "apa yang perlu diajar" daripada empat belas petikan.
SUBJECT MAP (16 concepts; the files explain 79% of it, this is about the material, NOT the student's mastery):
- Mitochondria: Mitochondria release energy from glucose. [taught: in our class we call the mitochondria the powerhouse of the cell] (builds on: Cytoplasm)
- Cytoplasm: Cytoplasm is the gel-like substance inside the cell membrane. (builds on: Cell Membrane)
- Chloroplasts: Chloroplasts are involved in photosynthesis. (builds on: Cell Wall)
- Endosymbiosis: Endosymbiosis explains the origin of mitochondria and chloroplasts. (builds on: Mitochondria, Chloroplasts)
…
Susunan kata pengepala itu sendiri adalah satu pengajaran. Versi pertama menyatakan "79% difahami", dan satu model yang membacanya dengan senang hati memberitahu seorang pelajar "berdasarkan tahap kefahaman anda sekarang sebanyak 79%…". Satu nombor kesediaan yang boleh dibaca sebagai penguasaan pelajar akan dibaca sedemikian; baris itu sekarang menyatakan tentang apa sebenarnya ia.
Mengajar subjek itu
Seseorang boleh menambah kepada peta dengan bercakap dengannya. "Ingat bahawa dalam kelas kami, kami gelar mitokondria sebagai loji kuasa sel" melekatkan satu nota diajar kepada konsep yang dinamakannya (penghalaan mengikut nama; padanan tepat sahaja), menetapkan kesediaan konsep itu kepada 1.0, menulis satu episod diajar, dan memasukkan nota itu ke dalam ringkasan. Apabila ayat itu tidak menamakan mana-mana konsep sedia ada, satu nod baharu dicipta pada lapisan diajar dengan satu nama ringkas, tidak sekali-kali seluruh ayat. Soalan tidak pernah mengajar; hanya satu "ingat bahawa", "anggap X sebagai" yang eksplisit, atau yang sepadan dengannya dalam bahasa pelajar itu, yang mengajar.
Kepercayaan yang mengekalkan sejarahnya
Satu kepercayaan ialah apa yang difikirkan oleh tutor pada masa ini tentang pelajar ini pada konsep ini: "bergelut dengan osmosis", "faham sitoplasma", dengan satu keyakinan dan episod di belakangnya. Peraturan yang penting: baris tidak pernah dikemas kini menjadi satu dakwaan yang berbeza. Apabila tutor menukar fikirannya, baris lama kekal tepat seperti asalnya, satu baris baharu dimasukkan, dan baris lama itu menunjuk kepada baris baharu tersebut. Ingatan semula hanya membaca baris yang tidak digantikan oleh apa-apa; satu laporan boleh menyusuri rantaian itu apabila seseorang bertanya apa yang berubah dan mengapa. Pengekalan dan kesemasaan adalah dua ciri yang berbeza, dan satu memori yang mengekalkan kedua-duanya adalah memori yang boleh dijadikan asas satu laporan.
Kepercayaan murah di tempat yang penting: kira-kira dua puluh token setiap satu, dan satu mewakili puluhan episod. Nisbah itu, bukan satu tetingkap yang lebih besar, adalah maksud sebenar "mengingati lebih daripada yang muat dalam konteks". Episod tidak digugurkan, ia adalah apa yang dijadikan rujukan semakan bagi satu kepercayaan, tetapi ia datang kedua dan pemanggil membelanjakan bajet yang berbaki padanya.
Kepercayaan itu tentang topik yang mana?
Inilah bahagian yang mula-mula pincang akibat data sebenar. Dalam mod ajar, "topik" satu semakan pernah menjadi kata-kata pelajar sendiri, jadi semakan yang dimainkan semula menghasilkan kepercayaan seperti faham ask me the questions dan bergelut dengan bueno ahora explícame todos los pasos. Kini topik satu semakan dihalakan kepada satu konsep mengikut nama, dan apabila rentetan topik itu satu ayat, melalui teks penilaian tutor sendiri (yang biasanya menamakan konsep itu) pada padanan nama tepat sahaja. Satu topik yang tidak sepadan dengan apa-apa dan berbunyi seperti satu ujaran, kata tanya, kata kerja bertanya, kata ganti nama, kata pengisi, dalam bahasa yang digunakan oleh pelajar kami, disimpan sebagai bukti tetapi tidak sekali-kali menjadi satu kepercayaan. Satu perubahan peraturan sedemikian memerlukan satu cara untuk menerbitkan semula: hentikan kepercayaan semasa (tidak sekali-kali dihapuskan), mainkan semula semakan yang berada di rekod di bawah peraturan hari ini, tanpa menyentuh mana-mana episod.
Satu pusingan, dalam bajet
Setiap pusingan sembang meminta satu blok daripada otak ini, dibina di luar laluan permintaan dengan satu had masa tegar. Sepanjang 155 pusingan, blok itu mengambil masa 295 ms pada median, 403 ms pada persentil ke-90 dan 445 ms pada persentil ke-95, dengan satu pembinaan melebihi satu saat dan tiada satu pun melebihi had 2.5 s, selepas mana bungkusan itu digugurkan dan bukan ditunggu, supaya satu memori yang perlahan tidak sekali-kali menghalang token pertama. Satu embedding soalan itu berfungsi untuk kedua-dua penghalaan dan ingatan semula. Blok itu masuk ke dalam slot memori sedia ada dalam prompt, sebelum petikan bahan, dan tiada apa-apa lagi tentang prompt itu berubah.
===== YOUR MEMORY OF THIS STUDENT AND SUBJECT ===== THE STUDENT IS ASKING ABOUT THEIR OWN RECORD. Answer from the beliefs and the earlier work listed here … WHAT YOU CURRENTLY BELIEVE ABOUT THIS STUDENT (from their checks; confidence 0–1): - understands cytoplasm (0.72) - understands eukaryotic cells (0.72) EARLIER WORK WITH THIS STUDENT (oldest first): - 12 Jul · you were asked: Can we go over Eukaryotic Cells today? I keep mixing it up. - 12 Jul · you answered: Of course. Eukaryotic Cells: Eukaryotic cells contain a nucleus and organelles. We worked through two examples and you got the second one right. - 18 Sep · the student taught you: Taught: in our class we call the mitochondria the powerhouse of the cell - 18 Sep · check: Check on cytoplasm: right (and 3 more times like it) SUBJECT MAP (16 concepts; the files explain 79% of it, …) … HOW TO USE THIS: it is your own memory of past work with this student, not their material. When you rely on it, say when it happened ("in July we…"). Never claim a memory that is not listed here. … ===== END OF MEMORY =====
Susunan dalam blok itu rupanya penting sama seperti kandungannya. Bagi satu soalan biasa, peta itu datang dahulu. Bagi satu soalan rekod: "apa yang saya buat salah sejauh ini", "apa yang telah kita pelajari", "ماذا أخطأت", kepercayaan dan kerja terdahulu datang dahulu dan peta itu terakhir, dengan satu baris pertama yang eksplisit menyatakan bahawa pelajar itu bertanya tentang rekodnya sendiri. Kami mempelajari ini daripada satu kegagalan: prompt itu turut membawa satu seksyen warisan "keputusan penilaian" yang bermula dengan "NO QUIZ ATTEMPTS recorded", dan model itu menjawab seorang pelajar yang telah menjawab dua puluh lapan semakan dalam perbualan dengan "anda belum mencuba mana-mana kuiz lagi". Satu model membaca kenyataan berautoriti pertama tentang satu rekod dan berhenti di situ. Blok memori itu kini mendahului seksyen tersebut, satu nota penghubung mengikat kedua-duanya bersama, dan satu seksyen penilaian yang hanya menyatakan "tiada direkodkan" digugurkan apabila blok memori itu wujud.
Pelajar: Apa yang saya buat salah pada semakan sejauh ini, dan apa yang perlu saya ulang kaji?
Tutor: Apa yang anda buat salah pada semakan: 1. Semakan tentang apa itu sel: separuh betul, anda menerangkannya sebagai "it's like a tiny thing?", yang tidak lengkap. Jawapan salah: anda menjawab "yes" dan "watter" pada dua kesempatan berasingan, yang ditanda salah. 2. Semakan tentang enzim: anda menyatakan dengan betul bahawa enzim adalah "proteins that break down food for easier digestion". Cadangan ulang kaji: memandangkan anda bergelut dengan apa itu sel: struktur sel (prokariotik lawan eukariotik)… komponen satu sel… contohnya, mitokondria melepaskan tenaga daripada glukosa, yang anda telah pelajari dalam kelas.
Menyatakan "saya tiada rekod"
Kegagalan paling mendidik dalam seluruh projek ini adalah satu skenario yang kami tulis untuk lulus: semaikan satu perbualan Julai, tanya "apa yang kita pelajari pada bulan Julai tentang X", semak jawapan itu. Jawapan itu bermula "Pada bulan Julai, kita pelajari X…" dan lancar, berasaskan sumber dalam fail, dan sepenuhnya rekaan, memori Julai itu tidak sampai ke prompt, dan model itu menceritakan Julai berdasarkan kerangka soalan itu sahaja. Dua sebab. Mod soalan-rekod itu hanya menyimpan semakan dan kuiz dan menggugurkan perbualan yang sebenarnya rekod itu; dan penceritaan lampau tutor sendiri ("Pada bulan Julai kita pelajari…", disimpan sebagai episod jawapan) sedang diimbas kembali seolah-olah ia memori Julai, otak itu mengingati bahawa ia mengingati.
sebelum "Pada bulan Jun, kita pelajari topik Membran Sel, yang diterangkan seperti berikut: membran sel adalah satu lapisan berganda fosfolipid…"
selepas "Saya tidak mempunyai sebarang rekod tentang apa yang khusus kita pelajari pada bulan Jun berkenaan membran sel. Walau bagaimanapun, saya boleh memberikan anda maklumat tentang membran sel daripada bahan yang kita ada…"
Kedua-dua kes ini kini adalah skenario dalam satu pelari ujian yang boleh diulang: skenario Julai itu lulus hanya jika memori Julai berada dalam prompt (disemak pada id memori tersimpan bagi mesej itu, bukan pada susunan kata jawapan itu), dan skenario bulan-kosong itu lulus hanya jika jawapan itu menyatakan ia tiada rekod dan tidak menerangkan satu sesi.
Memori sebagai rujukan
Sembang kami sudah mempunyai satu panel asal-usul: setiap dakwaan dalam satu jawapan dijejaki kepada satu baris dalam fail pelajar, dan satu jawapan dengan terlalu sedikit dakwaan terjejak ditanda sebagai sebahagian besar tidak berasaskan sumber. Penjejak itu hanya mengenali fail. Satu kenyataan yang betul "pada Julai kita pelajari X, dan anda betul pada contoh kedua" oleh itu akan dibaca sebagai bukan dalam nota anda: ciri itu menggelar satu kenyataan benar sebagai palsu. Jadi memori yang diingatkan kepada tutor itu disimpan pada jawapan tersebut, dan penjejak itu melayan setiap episod yang diimbas kembali sebagai satu lagi sumber, dilabel dengan bila ia berlaku.
Keputusan pengasasan yang sama memberikan setiap episod jawapan satu status: dijawab, separa, atau tidak dapat, disimpan selepas kejadian. Itulah cara laporan itu mengetahui soalan mana yang tidak dapat dijawab oleh fail, tanpa satu panggilan model kedua dan tanpa satu baris "rangka" tersembunyi dalam strim itu, yang telah kami cuba dan tolak: dalam mod jawapan biasa tiada apa yang menapis strim itu, jadi satu baris tersembunyi akan sampai kepada pelajar.
Memori yang menyemak dirinya sendiri
Satu memori yang tidak dapat menyemak dirinya sendiri menjadi lebih yakin dan kurang tepat dengan usia. Kerana bukti satu jawapan merekodkan cap jari fail pada masa itu, pengesahan adalah satu carian, bukan satu panggilan model: sah: fail yang dirujuk masih ada, tidak berubah; berubah: ia telah digantikan atau dibuang, dan nota itu menyatakan yang mana; tidak dapat disahkan: memori itu tidak merujuk mana-mana fail (satu perbualan, satu semakan). Jawapan ketiga itu adalah satu keputusan sah sepenuhnya, bukan satu ralat; melaporkan satu memori perbualan sebagai "sah" itulah kecacatan sebenar. Satu episod yang diimbas kembali tiba di prompt itu sudah dilabel: "[note: the file this cited has been replaced or removed since]".
Gelung waktu malam
Sekali setiap malam, bagi setiap pasangan pelajar-dan-subjek yang aktif dalam hari terakhir, satu kitaran deterministik berjalan tanpa panggilan model: mampatkan hari itu menjadi satu episod konsolidasi (kiraan mengikut jenis, jumlah semakan, topik, lima tajuk paling menonjol; satu hari yang senyap tidak menulis apa-apa, dan nota itu tidak pernah meringkaskan semula jenisnya sendiri); susutkan mana-mana kepercayaan yang tidak disentuh selama 45 hari sebanyak 15% dan tandakannya untuk disahkan oleh semakan seterusnya; tentukur penguasaan yang diramalkan oleh tutor sebelum setiap semakan berbanding keputusan sebenar; sahkan satu kelompok rujukan yang terhad, yang belum pernah disemak dahulu; bina semula set kerja yang kecil; susun semula model diri.
Penentukuran adalah semakan kejujuran atas keyakinan tutor: sebelum setiap semakan kami tahu penguasaan apa yang diramalkannya; selepas itu, kami tahu keputusan sebenar. Apabila dikumpulkan, itu menghasilkan satu lengkung kebolehpercayaan dan satu ralat penentukuran jangkaan, dan model diri itu melaporkan "tertentukur" hanya bermula daripada lima semakan yang mempunyai satu ramalan. Sehingga itu had-hadnya menyatakan begitu, anggap keyakinan sebagai satu susunan kedudukan, bukan satu kebarangkalian.
Apa yang diajar oleh sejarah sebenar
Skenario membuktikan mekanisme; ia tidak membuktikan bahawa sesuatu itu berfungsi mengikut cara manusia benar-benar bercakap. Jadi kami membina satu main semula: ambil sejarah pelajar-dan-subjek sebenar paling kaya, baca sahaja, bina semula setiap satu dalam salinan platform yang terasing, bina otak itu untuknya, dan tanya tiga soalan berbentuk sebenar melalui endpoint sembang sebenar sebagai pengguna itu. Enam pasangan, 65–142 mesej setiap satu, 13–32 keputusan mod-ajar setiap satu, satu dalam bahasa Sepanyol. Ia bukan satu sampel rawak dan tidak sepatutnya dibaca sebagai satu. Kami mengambil sejarah dengan sekurang-kurangnya 40 mesej, paling banyak dua bagi setiap pelajar, akaun ujian dan akaun dalaman dikecualikan, mengutamakan yang mempunyai paling banyak jawapan yang dinilai, kerana satu sejarah yang tiada apa-apa di dalamnya tidak menguji apa-apa. Ini memihakkan setiap angka di sini kepada pengguna berat. Subjek seorang pengguna ringan akan memberi memori itu lebih sedikit untuk diingat semula dan lebih sedikit untuk tersalah.
Ia juga menghasilkan tiga pembetulan yang diterangkan di atas: kepercayaan pada ayat pelajar, rekod dijawab daripada peta bukan daripada rekod itu sendiri, baris warisan "tiada percubaan kuiz" yang mendahului jawapan, dan satu pengesahan yang kami gembira melihatnya: satu konsolidasi menandakan sebelas memori yang failnya yang dirujuk tidak lagi wujud. Pengesah itu melakukan tugasnya.
| Subjek (sebenar, dimainkan semula) | Mesej | Semakan | Konsep | Kepercayaan selepas terbitan semula | Kesediaan peta |
|---|---|---|---|---|---|
| Modul algebra | 142 | 32 | 16 | 0, setiap topik semakan adalah satu ayat dan tiada penilaian menamakan satu konsep; semakan itu kekal di rekod dan laporan itu menyatakannya | 0.60 |
| Unit kesusasteraan | 97 | 14 | 10 | 3, semua berkunci-konsep | 0.68 |
| Komputeran & penyelesaian masalah | 91 | 29 | 7 | 4, semua berkunci-konsep | 0.60 → 0.81 |
| Biología (Sepanyol) | 88 | 31 | 15 | 6 (5 berkunci-konsep), kebanyakan "bergelut dengan…" selepas satu rentetan jawapan salah | 0.62 |
| Triple science | 75 | 13 | 16 | 2, kedua-dua berkunci-konsep | 0.64 |
| Buku kerja Pendidikan Agama | 65 | 18 | 12 | 6 (5 berkunci-konsep) | 0.72 |
Baris algebra itu adalah baris yang jujur. Tiga puluh dua semakan dan tiada kepercayaan, kerana tiada satu pun dapat dikaitkan dengan satu konsep: pelajar itu menjawab aritmetik, balasan tutor tidak pernah menamakan konsep bab itu, dan satu ujaran bukan satu topik. Laporan bagi pelajar itu menyatakan "32 semakan berada di rekod, tetapi tiada satu pun dapat dikaitkan dengan satu konsep dalam peta lagi" berbanding "belum ada semakan". Tiada apa direka, termasuk penguasaan itu.
Penanda aras, bukan demo
Semua yang disebut di atas adalah ukuran atau sampel: berapa lama sesuatu mengambil masa, apa yang dihasilkan oleh main semula, jawapan yang kami sukai. Tiada satu pun daripadanya membuktikan bahawa memori ini berbaloi, kerana tiada perbandingan dibuat dengan tutor yang sama tanpa memori tersebut. Oleh itu, kami menjalankan perbandingan itu. Satu set soalan yang didaftarkan lebih awal, empat reka bentuk tutor yang sama yang hanya berbeza dari segi apa yang sampai ke prompt, dan penilai yang merupakan perbandingan rentetan dan id, bukan pendapat, supaya jawapan yang sama sentiasa dinilai dengan cara yang sama.
Soalan-soalan dihasilkan bagi setiap subjek daripada data subjek itu sendiri yang telah direkodkan, dan itulah yang menjadikannya boleh dinilai: soalan tentang apa yang pelajar jawab salah disemak terhadap semakan yang benar-benar direkodkan, soalan tentang prasyarat disemak terhadap pinggir sebenar dalam peta konsep, soalan tentang sesuatu bulan disemak terhadap bulan-bulan subjek itu benar-benar aktif. Apabila sesuatu subjek menyokong lebih daripada satu, ia diberikan lebih daripada satu, jadi tiga konsep dan tiga bulan kosong dan bukannya satu bagi setiap satu. Enam kategori, 420 soalan yang dinilai bagi setiap reka bentuk, merentasi 45 sejarah pelajar sebenar yang dimain semula dalam salinan platform yang diasingkan dan ditanya melalui titik akhir sembang biasa sebagai pelajar tersebut.
Empat reka bentuk
Keempat-empat reka bentuk menjalankan dapatan semula yang sama ke atas fail yang sama. Dapatan semula biasa ialah tutor tanpa memori langsung. Tetingkap ialah jawapan pertama yang kebanyakan orang fikirkan: dua puluh giliran perbualan terakhir, dimasukkan begitu sahaja tanpa disusun mengikut kedudukan. Episod ialah capaian berperingkat log episod sahaja, tanpa peta konsep, tanpa kepercayaan, dan tanpa sebarang pengendalian khas bagi soalan rekod. Memori penuh ialah semua perkara dalam artikel ini.
Apa kata jadual
Secara keseluruhan, tutor ini meningkat daripada 168 daripada 420 kepada 383, iaitu 40 peratus berbanding 91. Purata adalah angka yang paling kurang menarik di sini; bentuk perbezaan itulah dapatannya.
Tetingkap lebih besar bukan jawapannya. Memasukkan dua puluh giliran terakhir ke dalam prompt meningkatkan markah daripada 40 peratus kepada 65, dan itulah sahaja manfaat yang diperoleh. Ia menjawab 5 daripada 32 soalan tentang apa yang pelajar jawab salah dengan betul, kerana dua puluh giliran sembang bukan tempat maklumat itu berada, dan ia masih lebih kerap silap tentang bulan kosong berbanding betul. Inilah jawapan "masukkan sahaja lebih banyak perbualan", diukur dan bukan sekadar didakwa.
Capaian berperingkat buat kebanyakan kerja. Log episod itu sahaja mencapai 83 peratus. Jika anda hanya membina satu perkara, binalah ini: log tambah-sahaja yang dinilai mengikut relevans, itulah sebahagian besar nilai artikel ini.
Peta konsep dan kepercayaan itu bernilai bagi 33 soalan selebihnya, dan ia diperoleh di dua tempat khusus sahaja, bukan di merata-rata. Apabila ditanya apa yang perlu diulang kaji sebelum sesuatu topik, reka bentuk tanpa peta konsep menjawab dengan betul kira-kira 55 peratus daripada masa, manakala memori penuh mencatat 96, kerana prasyarat adalah pinggir dan log episod tiada pinggir langsung. Apabila ditanya apa yang pelajar jawab salah, kepercayaan dan cawangan rekod meningkatkan markah daripada 24 daripada 32 kepada 30. Apabila diminta menerangkan konsep, peta konsep tidak menambah apa-apa langsung: 100 pada kedua-dua keadaan.
Dapatan semula biasa, bulan tanpa aktiviti Betul hanya 1 daripada 132. Apabila ditanya apa yang dibincangkan pada bulan pelajar tidak pernah aktif, ia menerangkan bahan tersebut dan mengaitkan bulan itu dengannya, hampir pada setiap kesempatan.
Memori penuh, soalan sama 128 daripada 132. Ia menyatakan bahawa ia tiada rekod bagi tempoh tersebut dan menawarkan apa yang ada padanya.
Kos untuk mendapatkannya
Had penanda aras ini
Angka terakhir itulah yang perlu diingat semasa membaca bahagian selebihnya. Kami menanyakan memori penuh 420 soalan yang sama buat kali kedua, dan 44 daripadanya mendapat markah berbeza. Jadi, bunyi bising antara larian adalah kira-kira satu persepuluh, jurang 33 soalan antara dua reka bentuk teratas jauh melangkaui itu, dan jurang 2 soalan antara kedua-duanya pada bulan kosong tidak: pada kategori itu kedua-duanya seri dan kami tidak akan mendakwa sebaliknya.
Satu kategori didapati tidak bernilai, dan kami mengekalkannya dalam carta itu dan bukan mengeluarkannya secara senyap-senyap. Bulan pelajar itu adalah aktif mendapat markah 44 daripada 44 bagi setiap reka bentuk, termasuk reka bentuk yang langsung tiada memori. Ia tidak dapat membezakan ingatan yang berpengasasan dengan penerangan yang munasabah tetapi kebetulan menyebut bulan yang betul, iaitu kegagalan yang tepat ditangkap oleh kategori kembarnya. Ujian yang semua orang lulus tidak mengukur apa-apa.
Penilai adalah perbandingan rentetan yang ditulis oleh orang yang sama yang membina ciri ini. Ia memberi ganjaran kepada jawapan yang menggunakan semula perkataan yang direkodkan dan tidak dapat mengecam jawapan yang betul tetapi disusun dengan kata-kata yang sama sekali berbeza, dan ia pernah merugikan kami dengan teruk: soalan prasyarat dihasilkan dengan arah pinggir yang terbalik, jadi untuk sekian lama kategori ini kelihatan sebagai yang paling lemah bagi memori, sedangkan tutor sebenarnya memberikan jawapan peta konsep itu sendiri dan ditandakan salah untuknya. Ia sebenarnya kategori terkuat bagi peta konsep. Kami mendapati hal ini dengan membaca kegagalan-kegagalan, bukan jumlah keseluruhan, kerana itulah satu-satunya cara kesilapan seperti ini dapat dikesan.
Dan populasi ini bukan rawak. Ini adalah 45 sejarah sebenar yang dipilih kerana mempunyai sesuatu di dalamnya: sekurang-kurangnya lima belas mesej, fail yang dilampirkan, dan bagi kategori yang memerlukan jawapan bergred, sekurang-kurangnya lima daripadanya. Pelajar yang baru sahaja bermula akan menguji jauh lebih sedikit daripada ini, dan akan melihat jauh lebih sedikit perbezaan itu.
Apa Ini Bukan
Empat perkara yang sering disangka sebagai ini, dan apakah ia yang sebenarnya.
- Bukan tingkap konteks yang lebih besar. Kos bagi setiap giliran adalah terhad dan tidak bertambah mengikut panjang sejarah. Penanda aras ini meletakkan angka pada perbezaan itu: tetingkap naif menjawab 65 peratus daripada 420 soalan berbanding 91 peratus oleh memori.
- Bukan peringkasan. Tiada apa-apa yang ditulis semula. Episod tidak boleh diubah, satu pembetulan ialah satu baris baharu yang menunjuk kepada yang lama, dan kepercayaan bulan Mac masih boleh dibaca selepas digantikan oleh kepercayaan bulan Ogos.
- Bukan carian vektor ke atas log sembang. Indeks vektor hanyalah satu daripada empat kelompok, dan penyusunan kedudukan menggunakan relevans sebagai get sebelum kebaruan, ketaraan atau kekerapan mendapat sebarang kata.
- Bukan profil pelajar yang ditulis oleh model. Tiada satu pun laluan ke atas sejarah itu menghasilkan satu keterangan tentang pelajar. Setiap kepercayaan ialah satu jalur yang dikira daripada jawapan yang dinilai, dengan id-id bukti dilampirkan dan satu rantaian penggantian di belakangnya.
Apa sebenarnya ia: satu bacaan terbatas ke atas satu log yang tidak boleh diubah, satu graf bahan yang diekstrak sekali bagi setiap fail, dan kepercayaan yang membawa buktinya sendiri.
Prinsip yang kami pegang
- Tiada apa direka. Penguasaan hanya datang daripada semakan, kuiz dan pusingan; satu konsep wujud hanya kerana satu fail menjelaskannya atau seseorang mengajarnya; satu tempoh kosong menyatakan begitu.
- Bukti, atau ia tidak berlaku. Setiap kepercayaan, setiap baris laporan, setiap jurang membawa id apa yang menjadi asasnya, dan panel rujukan menunjukkan memori di sebelah halaman.
- Pengekalan bukan kesemasaan. Simpan kepercayaan Mac itu selama-lamanya; jangan sekali-kali menjadikannya asas sebaik sahaja Ogos menggantikannya. Satu pembetulan adalah satu baris baharu dengan satu pautan, tidak sekali-kali satu suntingan.
- Relevans mengatasi kebaruan. Lebarkan sebelum anda memotong; gunakan get, jangan sekadar memberi pemberat.
- Penceritaan tutor sendiri bukan memori. Satu jawapan yang menceritakan semula rekod itu ditanda semasa ditulis dan tidak pernah diimbas kembali sebagai satu memori subjek itu.
- Susunan adalah kandungan. Satu model membaca kenyataan berautoriti pertama tentang satu rekod dan berhenti; letakkan rekod itu sebelum apa-apa lagi yang boleh disalahertikan sebagainya.
- Satu ujaran adalah bukti, tidak sekali-kali satu topik. "Ask me the questions" boleh betul atau salah; tiada siapa memahaminya.
- Satu memori mesti dapat menyemak dirinya sendiri. Rekodkan cap jari itu pada masanya; sahkan melalui carian; anggap "tidak dapat disahkan" sebagai satu jawapan.
Keseluruhannya adalah beberapa ribu baris, kebanyakannya biasa: satu lejar, satu graf, satu fungsi pemberian skor, satu penjana dengan satu bajet, dan satu tugas malam. Bahagian yang sukar bukan kod itu tetapi membuat keputusan, setiap kali model itu berkata sesuatu yang lancar tetapi salah, bahawa pembetulan itu tergolong dalam memori, bukan dalam nada suara prompt itu.