LLM・トークン・Transformerをつなげる
文章がモデルに渡され、次の要素が生成されるまでの基本を整理します。
この単元でわかること
- LLMとトークンの意味を説明できる
- TransformerのAttentionの役割を理解する
- コンテキストウィンドウの限界を説明できる
01文章は、トークンという単位で処理される
大規模言語モデルは、一般に大量の言語データから規則性を学んだモデルで、LLMと略されます。文章はそのまま一つの塊として扱われるのではなく、トークンと呼ばれる単位に分割されます。
トークンは単語、単語の一部、記号などに対応し、日本語の一文字や一単語と常に一致するわけではありません。多くの文章生成モデルでは、与えられた文脈と、それまでに生成したトークンを手掛かりに、次に続くトークンの確率を計算し、生成を進めます。
自然な文章ができることと、内容が真実であることは別です。
- トークン数と文字数は同じではない
- もっともらしい続きが事実とは限らない
次の候補を計算して文へ加える流れを繰り返し、生成済みの内容も次の計算に使います。
文章を続ける
入力した質問と資料を文脈にして文章を生成しますが、引用や日付が正しいかは元の資料で確認します。
図は生成の概念を示すもので、実際のトークン分割、処理回数、確率はモデルによって異なります。
02Attentionで、文脈中の関係を捉える
Transformerで重要なAttentionは、文脈中のどの情報を重視するかを計算する仕組みです。例えば「箱を棚に置いた。それは重かった」という文では、代名詞が何を指すかを考えるために、離れた語の関係が重要になります。
Self-Attentionは入力内の要素どうしの関係を扱います。Transformerは並列処理を活用できる点でも注目され、LLMの発展を支えました。ただし、注意の計算は人間の注意力や理解そのものではなく、学習された数値に基づく処理です。
- 離れた要素の関係を捉えることができる
- 人間の理解と同じ仕組みと断定しない
03一度に参照できる情報には上限がある
コンテキストウィンドウは、モデルが一度の処理で扱える情報量の範囲です。ユーザーの質問だけでなく、会話履歴、参照資料、システムからの指示なども関係し、扱いはサービスによって異なります。
長い資料を入れるだけで必要な箇所を正確に利用できるとは限りません。目的に必要な情報を選び、章や見出しを保って渡す工夫が役立ちます。会話中に情報を渡すことは、モデルの重みを更新する追加学習とは別です。
会話を覚えて見える現象も、この区別で理解できます。
- 長い文脈を入れれば精度が必ず上がるわけではない
- 会話履歴の参照と追加学習を区別する
ここまで、おつかれさまでした。
読み終えたら学習済みに。4問の確認問題で、覚えた知識を確かめましょう。
出題範囲の参照:GUGA公式シラバス(2027年2月以降)。教材は独自に制作しています。確認日:2026年10月3日。