AI研修 初心者向け / 第1章: はじめての生成AIと最新トレンド
文字・画像・音声で支えるマルチモーダル
無料公開レッスン / 読了目安 2 分
最新のAIトレンドを語る上で欠かせないのが、テキスト(文字)だけでなく、画像、音声、動画といった複数の種類のデータを一度に理解・生成できる「マルチモーダルAI」の進化です。
たとえば、Googleの「Gemini Live」では、人間と自然に相づちを打ちながらリアルタイムで音声対話ができるほか、画像生成ツール「Nano Banana」や動画生成モデル「Gemini Omni」によって、プレゼン資料に必要なイラストや動画素材をプロンプト一つで直感的に作成できます。
また、OpenAIの「ChatGPT Images 2.5」のように、生成した画像の特定部分だけを修正したり、落書きのスケッチを清書して綺麗なデザインに仕上げたりする機能も日常業務で手軽に使えるようになっています。
文字で説明するのが難しい手書きの図や音声データであっても、AIがそのまま意図を読み取り、多角的に私たちの業務やクリエイティブな作業を強力にバックアップしてくれます。

関連動画
【動画生成AI】Gemini Omni(オムニ)+Flowを徹底解説!思考するマルチモーダル動画エージェントが登場!(テキスト・AIイラスト・AI動画からAI動画生成への実践解説)
【ナノバナナ超え】OpenAIの新しい画像生成AIモデル「GPT Image 2(ChatGPT Images 2.0)」とは?|性能・使い方・活用事例まで全部解説!