画像・音声・動画とマルチモーダル
モダリティの違い、拡散モデル、生成物を扱う際の確認点を学びます。
この単元でわかること
- モダリティとマルチモーダルを説明できる
- 拡散モデルの基本的な考え方を理解する
- 生成メディアの品質と権利を確認できる
01一つのAIが複数の種類の情報を扱う
モダリティは、文章、画像、音声、動画など、情報の種類や表現形式を指します。マルチモーダルなモデルは、複数の種類の情報を受け取り、関係づけたり生成したりできます。例えば、写真と質問文から状況を説明する、音声から文字を起こして要約する、といった使い方があります。
ただし、すべてのサービスがあらゆる入出力を扱うわけではありません。画像を読み取れることと、画像を生成できることも別の機能です。入力形式と出力形式を具体的に確かめましょう。
- 画像の理解と画像の生成は別の能力
- モデルごとに対応する入出力を確認する
入力の候補
出力の候補
「画像を読める」と「画像を作れる」は別の能力
受け取れる情報と作れる情報を分け、利用するサービスがどの入出力に対応するかを確認します。
写真と質問から説明を作る
写真と質問文を入力し、その写真の説明を文章で受け取る使い方があります。
図にあるすべての入出力へ、一つのモデルが対応するとは限りません。画像を読む能力と画像を作る能力は別です。
02ノイズから画像を作る拡散モデル
拡散モデルは、データにノイズを加える過程と、そのノイズを取り除く過程に着目した生成モデルです。生成時には、ノイズから段階的に構造を作る考え方が用いられます。画像全体の作成だけでなく、一部を指定して描き直すインペインティングなどにも応用されます。
生成方法には他の方式もあり、すべての画像や動画AIが同一の構造とは限りません。見た目が自然でも、文字、指の形、物体の数、前後の場面の連続性などに誤りが生じることがあるため、目的に沿って点検します。
- ノイズを除く過程を学ぶのが基本的な考え方
- 自然な見た目と細部の正確さは別に確認する
03音声や映像は、同意と来歴も確認する
音声合成は文章から音声を作り、ボイスクローニングは特定の声の特徴を再現する技術です。本人の声に似て聞こえるからこそ、同意や利用範囲の確認が重要になります。動画でも、実在の人物が発言したように見せることができます。
制作物を公開する前に、素材の利用条件、人物の扱い、誤認を与える表示がないかを確かめましょう。来歴情報や電子透かしは確認の手掛かりですが、付いていないから偽物、付いているから内容が真実、と機械的には判断できません。
- 声や顔の再現では同意と利用目的を確認
- 来歴情報は内容の真実性を自動保証しない
ここまで、おつかれさまでした。
読み終えたら学習済みに。4問の確認問題で、覚えた知識を確かめましょう。
出題範囲の参照:GUGA公式シラバス(2027年2月以降)。教材は独自に制作しています。確認日:2026年10月3日。