项目 01

从零实现 GPT-2

从文本分词一路实现到自回归训练,并把过程中提出的问题、失败的假设和验证证据完整保留下来。

当前状态
准备中
开始时间
尚未开始
计划使用
Python · PyTorch · NumPy · GPT-2 reference implementation

这个项目还没有开始。目前先展示计划,以及后续记录会采用的结构。

想弄明白什么

把数据和梯度从头到尾怎么流动真正弄明白:能讲清每个模块的边界,能复现一个小模型,出了问题能自己定位,而不是把参考实现当黑盒。

开发计划

  1. 01
    进行中

    基础概念与 Tokenizer

    文本表示、byte-level BPE、词表以及可逆的编码与解码。

  2. 02
    计划中

    数据管线

    序列窗口、批处理、训练目标和可复现的数据加载。

  3. 03
    计划中

    Transformer 模型

    Embedding、因果注意力、MLP、归一化和残差路径。

  4. 04
    计划中

    训练与评估

    优化、Checkpoint、采样、评估和失败分析。

相关记录

项目推进后,我会把每个阶段遇到的问题、实现过程和验证结果补充在这里。

01

Tokenizer · 前期准备

计划中

开始写 Tokenizer 之前:文本究竟如何变成 Token?

这是一篇预览记录,先分清项目里第一组容易混在一起的概念:Unicode 文本、UTF-8 字节、BPE 合并规则和模型最终收到的 Token ID 之间是什么关系。

  • GPT-2
  • Tokenizer
  • Byte-level BPE
阅读记录