事前学習から推論まで。モデルができる過程
事前学習、ファインチューニング、RLHF、推論モデルの役割を分けて学びます。
この単元でわかること
- 事前学習と追加学習を区別できる
- RLHFの目的を説明できる
- 推論時の計算と学習を混同しない
01広い知識と表現の土台を作る事前学習
事前学習は、大量のデータから汎用的な特徴やパターンを学ぶ段階です。言語モデルでは、文脈に続くトークンを予測する課題などを通じて、文章の構造や多様な関連性を学習します。データの規模だけでなく、品質、偏り、重複、権利関係も重要です。
学んだ情報は辞書の見出しのようにそのまま保管されるとは限らず、パラメータという数値に反映されます。そのため、学習済みのモデルに質問すれば、いつでも出典を正確に取り出せるという理解は適切ではありません。
- 学習データの品質や偏りも性能を左右する
- モデルの内部は出典付きの資料庫とは異なる
02指示への応答や振る舞いを調整する
ファインチューニングは、学習済みモデルを追加のデータで調整する方法です。指示と望ましい回答の組を使う学習などにより、用途や応答形式へ適合させます。RLHFは、人間の評価を手掛かりに望ましい出力へ近づける学習手法の一つです。
役に立つことや安全な応答を目指しますが、人の評価にも偏りやばらつきがあり、誤りを完全になくすものではありません。企業独自の知識を扱う際は、追加学習が必要なのか、検索で根拠を渡す方が適切なのかを検討します。
- 調整の目的は用途や望ましい振る舞いへの適合
- 人間の評価を使っても正確性の保証にはならない
03推論時に考えるための計算を使う
推論は、学習済みモデルが入力に対して結果を作る段階です。推論モデルでは、回答に至るまでの計算を増やすなどの工夫で、複雑な問題への対応を目指します。ただし、処理時間や費用との兼ね合いがあり、すべての作業に最も大きなモデルが必要とは限りません。
分類や定型文の整形なら、小さなモデルでも目的を達成できる場合があります。学習の時点、検索の有無、ツールへの接続、出力の検証方法を合わせて確認することで、適切な利用方法を判断できます。
- 推論時の計算には時間や費用がかかる
- 作業の難しさと必要な品質に合わせてモデルを選ぶ
学習|モデルを作る・調整する
推論|新しい入力に答える
「学習」ではモデルを調整し、「推論」ではそのモデルを使って新しい入力へ答えます。
業務の回答形式を整える
追加データで用途に合わせて調整することと、完成したモデルへ一件ずつ質問することを分けて考えます。
学習の構成はモデルによって異なります。推論のたびに重みが必ず更新されるわけではなく、RLHFも人が毎回回答を修正する仕組みではありません。
ここまで、おつかれさまでした。
読み終えたら学習済みに。4問の確認問題で、覚えた知識を確かめましょう。
出題範囲の参照:GUGA公式シラバス(2027年2月以降)。教材は独自に制作しています。確認日:2026年10月3日。