プロジェクト 01

GPT-2 をゼロから実装する

テキストの tokenization から自己回帰学習までを実装し、問い、誤った仮説、検証の証拠を残す学習プロジェクトです。

状態
準備中
開始
未開始
使用予定
Python · PyTorch · NumPy · GPT-2 reference implementation

このプロジェクトはまだ始まっていません。現在は計画と、今後の記録に使う構成を表示しています。

知りたいこと

データと勾配の流れを最後まで理解し、各モジュールの境界を説明でき、小さなモデルを再現でき、参照実装をブラックボックス扱いせずに問題の原因を突き止められるようになることが目標です。

開発プラン

  1. 01
    進行中

    基礎と Tokenizer

    テキスト表現、byte-level BPE、語彙、可逆な encode/decode。

  2. 02
    予定

    データパイプライン

    系列ウィンドウ、バッチ、教師データ、再現可能なデータ読み込み。

  3. 03
    予定

    Transformer モデル

    Embedding、因果的 attention、MLP、正規化、残差経路。

  4. 04
    予定

    学習と評価

    最適化、checkpoint、sampling、評価、失敗分析。

関連する記録

プロジェクトが進んだら、各段階で生まれた疑問、実装の過程、検証結果をここに追加します。

01

Tokenizer · 準備

計画中

Tokenizer を書く前に:テキストはどう Token になるのか

プロジェクトで最初に整理すべき概念、つまり Unicode テキスト、UTF-8 バイト、BPE マージ、モデルが受け取る Token ID の関係をまとめるプレビュー記録です。

  • GPT-2
  • Tokenizer
  • Byte-level BPE
記録を読む