なんとなく使ってたLLM、中身を見るなら自分で作るしかない説
ここ注目: LLMを「使う」じゃなくて「作る」方に踏み出せるリポジトリかもしれない。スクラッチからの実装例があるっぽい。
どう使う?: 既存モデルをそのまま使うんじゃなくて、仕組みを理解しながら自分で組みたい場面で使う感じ。ライブラリに頼らず、アーキテクチャの構造を手を動かして確かめたいときに向いてる。
なんでいいの?: 正直、フレームワークの薄いラッパーじゃなくて、ゼロから書いてる感じがいい。たぶん、学習ループとか注意機構の実装を追うことで、なんとなく使ってたLLMの中身が見えてくるんじゃないかな。
まず試す: 自分ならまず小さいデータセットで学習ループを回してみる。train.py みたいなファイルがあれば、パラメータをいじって損失の動きを観察するかも。既存モデルと比べて、どの部分が本質的でどこが最適化の話か見えてきそう。