计划中
开始写 Tokenizer 之前:文本究竟如何变成 Token?
这是一篇预览记录,先分清项目里第一组容易混在一起的概念:Unicode 文本、UTF-8 字节、BPE 合并规则和模型最终收到的 Token ID 之间是什么关系。
- GPT-2
- Tokenizer
- Byte-level BPE
项目 01
从文本分词一路实现到自回归训练,并把过程中提出的问题、失败的假设和验证证据完整保留下来。
这个项目还没有开始。目前先展示计划,以及后续记录会采用的结构。
把数据和梯度从头到尾怎么流动真正弄明白:能讲清每个模块的边界,能复现一个小模型,出了问题能自己定位,而不是把参考实现当黑盒。
文本表示、byte-level BPE、词表以及可逆的编码与解码。
序列窗口、批处理、训练目标和可复现的数据加载。
Embedding、因果注意力、MLP、归一化和残差路径。
优化、Checkpoint、采样、评估和失败分析。
项目推进后,我会把每个阶段遇到的问题、实现过程和验证结果补充在这里。
计划中
这是一篇预览记录,先分清项目里第一组容易混在一起的概念:Unicode 文本、UTF-8 字节、BPE 合并规则和模型最终收到的 Token ID 之间是什么关系。