計画中
Tokenizer を書く前に:テキストはどう Token になるのか
プロジェクトで最初に整理すべき概念、つまり Unicode テキスト、UTF-8 バイト、BPE マージ、モデルが受け取る Token ID の関係をまとめるプレビュー記録です。
- GPT-2
- Tokenizer
- Byte-level BPE
プロジェクト 01
テキストの tokenization から自己回帰学習までを実装し、問い、誤った仮説、検証の証拠を残す学習プロジェクトです。
このプロジェクトはまだ始まっていません。現在は計画と、今後の記録に使う構成を表示しています。
データと勾配の流れを最後まで理解し、各モジュールの境界を説明でき、小さなモデルを再現でき、参照実装をブラックボックス扱いせずに問題の原因を突き止められるようになることが目標です。
テキスト表現、byte-level BPE、語彙、可逆な encode/decode。
系列ウィンドウ、バッチ、教師データ、再現可能なデータ読み込み。
Embedding、因果的 attention、MLP、正規化、残差経路。
最適化、checkpoint、sampling、評価、失敗分析。
プロジェクトが進んだら、各段階で生まれた疑問、実装の過程、検証結果をここに追加します。
計画中
プロジェクトで最初に整理すべき概念、つまり Unicode テキスト、UTF-8 バイト、BPE マージ、モデルが受け取る Token ID の関係をまとめるプレビュー記録です。