// Inside a real model · GPT-2 (124M)

Transformer内部の可視化

左=768次元の内部状態を PCA で2次元へ投影(次元削減のため距離関係は厳密には保たれません=目安)。中央=アテンション、右=次トークン予測。中央と右はモデルの実値です。層スライダーで3つが同期します。

01 / トークン軌跡

768D → 2D projection(目安)

02 / アテンション

どのトークンを参照したか(実値)

03 / 予測 logit lens

各層の次トークン上位5(実値)

Layer0 / 12

// 正直な但し書き:これは「AIの思考そのもの」ではなく、Transformer 内部状態の低次元投影実アテンション・実予測の可視化です。点の位置は近似(次元削減でゆがみます)。確信に満ちた誤り(自信満々の作話)は内部観測だけでは捉えられません——だから KR works は、出力を物理法則で外側から監査します。