MicroGPT
一個看得完的語言模型
4192 個參數、199 行純 Python——結構與大型模型完全相同,只是縮小
← → 翻頁 ・ f 全螢幕
先看結果執行這支程式,會得到什麼
讀 32033 個真實人名,寫出 20 個不存在的名字
概念 1自回歸:一次一個 token
輸出成為下一輪的輸入
概念 2推論的五個步驟
文字進來,一個 token 出去
概念 3① Tokenize:文字換成編號
先決定一份固定的清單,模型終其一生只認得表上的項目
概念 4② Embedding:編號換成向量
兩張對照表,一次查表、一次相加
概念 5Transformer 內部的三件事
Attention 溝通 ・ MLP 加工 ・ 殘差疊加
概念 6放大看 Attention
三種角色 ・ 取用比重 ・ 多個頭
概念 7④ 打分與 ⑤ 抽樣
從一條向量,到真的寫出一個字母
概念 84192 個參數在哪裡
模型裡只有兩種東西:查表得到的數字,與固定的算法