マルチモーダルAI とは(テキスト+画像+音声)
この記事は約5分で読めます
ざっくり言うと
マルチモーダルAIとは、文字・画像・音声・動画といった複数の形式の情報を、まとめて扱えるAIのことです。ひとことで言えば「文字以外も一緒に渡せるAI」。
AIのなかには、文章だけ、あるいは画像だけしか扱えないものがあります。一方で、写真と質問文を一度に受け取れるチャットAIも増えてきました。
ただし、何を渡せて何が返ってくるかは、モデルや製品によって変わります。ここを分けて見られるようになると、サービス選びで迷いにくいですよね。
イメージ
情報の種類のことを、専門用語では「モダリティ(modality)」と呼びます。マルチ(multi)は複数という意味なので、マルチモーダルは「複数のモダリティを扱う」となります。
文字・画像・音声・動画は、それぞれ別のモダリティです。聞き慣れない言葉ですが、「情報の種類」と読み替えてしまって構いません。
正確には
IBMは、マルチモーダルAIを「テキスト・画像・音声・動画など複数の種類(モダリティ)の情報を処理し、統合できる機械学習モデル」と説明しています。
対になる言葉が「ユニモーダル(単一モーダル)」で、こちらは1種類の情報だけを扱います。1種類しか扱えないAIと、どこが違うのか
| 見るところ | シングルモーダル | マルチモーダル |
|---|---|---|
| 扱える情報 | 1種類のみ(例: 文章だけ) | 複数(文章・画像・音声 等) |
| 処理 | 1種類のデータ内で処理 | 複数のデータを結び付けて処理 |
| 例 | テキストだけの分類モデル | 画像と質問文から回答するモデル |
何を渡すと、何が返ってくるか
できることは、渡せる情報の形式と、返ってくる形式の組み合わせで決まります。よくある組み合わせを並べました。
| 入力 → 出力 | できること | 身近な例 |
|---|---|---|
| 画像 → 文章 | 写っているものを説明する | 写真を見せて「これ何?」と聞く |
| 文章 → 画像 | 文章から絵を作る | 「猫が宇宙服を着てる絵」を作る |
| 音声 → 文章 | 話した内容を文字に起こす | 会議の議事録づくり、字幕づくり |
| 文章 → 音声 | 文章を声で読み上げる | AIナレーション、音声アシスタント |
| 画像+文章 → 文章 | 画像を見ながら質問に答える | レシートを見せて経費分類を相談 |
写真を見せて文章で答えてもらう使い方なら、複数になっているのは入力だけです。返ってくるものにも写真や声が混じるなら、出力側も複数です。世の中で「マルチモーダル」と呼ばれているものには、この両方が混ざっています。
「何でも得意」という意味ではありません
ですから、サービスを選ぶときは入力と出力を分けて確かめてください。「PDF対応」と書かれていても、文字だけを読むのか、図表や写真まで読めるのかは製品によって違います。
- 入力
写真、PDF、音声、動画のうち、どれを渡せるか - 出力
文章、表、画像、音声のうち、どれで返ってくるか - 制限
ファイルサイズ、ページ数、対応形式、保存期間はどうか
確かめる場所は、各サービスの公式ヘルプです。対応範囲はプランや時期で変わるので、契約する前に、使う予定のプランのページを開いて上の3点を探してみてください。
同じ「画像対応」でも、領収書の文字を読むのが得意なものと、写真の雰囲気を説明するのが得意なものがあります。金額や日付を扱うときは、AIが読み取った内容を自分の目で確かめる前提で使うと安心です。
いま主なAIはどこまで対応しているか
代表的な3社を比べると、対応している入力形式にも違いがあります。
| 会社・モデル | 対応する入力形式 |
|---|---|
| OpenAI(GPT-4o、2024年発表) | テキスト・音声・画像・動画 |
| Google(Gemini API) | 画像・音声・動画 |
| Anthropic(Claude) | 画像(Vision機能) |
ただし、各社のすべてのモデル・すべてのプランが同じ入出力に対応するわけではありません。画像を入力できても、返ってくるのは文章だけ、というモデルもあります。
注意点
やってみよう
似た言葉に「生成AI」「LLM(大規模言語モデル)」もあります。LLMは言葉を中心に扱うモデルを指し、マルチモーダルは複数の形式を扱えるという性質を指す言葉です。LLMを土台にして、画像や音声の処理を組み合わせたモデルやシステムもあります。
よくある質問
- Q. 写真や音声も、そのままAIに渡せるのですか?
- A. 複数の形式をまとめて扱えるマルチモーダルのAIなら渡せます。花の写真と質問文を一緒に受け取り、両方を見たうえで文章で答えます。ただし何を渡せるかは、モデルや製品によって違います。
- Q. 「画像対応」と書かれていれば、どんな画像でも正しく読み取れますか?
- A. 複数の形式を扱えるという意味で、どの形式も同じ精度という意味ではありません。文字は得意でも図表は苦手、写真は読めても細かい数字は間違えることがあります。金額や日付は自分の目で確かめてください。
- Q. マルチモーダルのサービスを選ぶとき、どこを確かめればいいですか?
- A. 入力と出力を分けて見ます。写真・PDF・音声・動画のどれを渡せるか、文章・表・画像・音声のどれで返ってくるか、そして対応形式などの制限を、使う予定のプランの公式ヘルプで確かめてください。
- Q. 写真をAIに渡すとき、気をつけることはありますか?
- A. 画像に写り込んだ情報も、渡した時点で一緒に送られます。社員証や名刺、契約書の固有名詞などが入っていないかを見て、社内の取り扱いルールと利用規約を確認してから渡してください。
公開: 更新: ✓ 公式情報と照合:
参考ソース
判断クイズ
「画像対応」と書かれたAIに、写真を渡してよいか判断できますか?
3問です。答えるとその場で解説が出ます。全問終えたら、「回答を記録する」で学習の記録に残せます。
全問に答えると、回答を記録できます。
残るのは「答えたかどうか」だけで、正解数は保存されません。この端末の中だけに残り、別の端末には引き継がれません。
この教科書は無料で全文公開しています。仕事で使えるところまで進みたい方は、実習と資料がそろった生徒プランをどうぞ。
あわせて読みたい
- AI基礎 | 用語集約6分
マルチモーダル
マルチモーダルとは、AIが文字・画像・音声・動画など複数の種類の情報をまとめて扱える性質のことです。言葉の意味と、対応表を見るときのコツを短くまとめました。内容を見る - AI基礎 | 用語集約6分
音声認識(Speech-to-Text)
音声認識(Speech-to-Text、STT)とは、人が話した声をコンピューターが文字に変える技術です。会議の文字起こしや動画の字幕、音声入力での使いどころと、気をつけたい点をやさしく説明します。内容を見る - ChatGPT | 便利な機能・小ワザ約9分
ChatGPTに画像を読み込ませて中身を聞く
レシート・仕入伝票・手書きメモの写真をChatGPTに見せて、中身を読み取ってもらう使い方をやさしく解説します。読み取った金額をそのまま月別の集計表やグラフにつなげる流れまで、初心者向けにまとめました。内容を見る - Claude | 便利な機能・小ワザ約8分
Claudeに画像を読み込ませて中身を聞く
名刺の束・領収書・契約書のスキャンをClaudeに見せて、「文字に起こして」「この条項はどこ?」と聞く使い方をやさしく解説します。Claudeは絵を描けませんが、読むほうは得意です。読み取った内容を1枚の資料に整えるところまで紹介します。内容を見る