Google Veoは、Google DeepMindが開発した動画生成AIです。シーンを文章で説明するか画像を渡すだけで、映像に合った音声つきの短い動画を生成してくれます。最新版のVeo 3.1では最大4Kで4〜8秒のクリップを作成でき、セリフや効果音、音楽も映像と同時に生成されます。
ひと言でまとめるとこうなりますが、実際はもう少し複雑です。Veoにはこれまで4つの世代があり、現行モデルだけでも3つのグレードに分かれています。公式に使える場所も、少なくとも4つあります。この記事では、Veoとは何か、各バージョンの違い、得意なことと苦手なこと、無料で使えるのか、そしてSora 2などの競合と比べてどうなのかをまとめて解説します。
要点まとめ
- 概要:Google DeepMindが開発した、テキストや画像から動画を生成するモデル群です。2024年5月に初めて発表されました。
- 最新バージョン:Veo 3.1(2025年10月リリース、2026年1月に機能拡張)。Veo 3.1、Veo 3.1 Fast、Veo 3.1 Liteの3種類があります。
- 注目される理由:Veo 3以降、すべてのクリップにネイティブ音声がつきます。口の動きと同期したセリフも生成できます。
- 出力:4秒・6秒・8秒のクリップで、解像度は720p〜4K、横長(16:9)または縦長(9:16)に対応。シーン延長を使えば、クリップをつなげて1分以上のシーンも作れます。
- 無料で使えるか:条件つきで可能です。GoogleやVeo Studioなどのサードパーティアプリで、回数限定の無料生成が用意されています。継続的に使うなら有料です。
- Veo 4:2026年10月時点ではリリースされていません。
Google Veoとは?
Google Veoは、Geminiを手がけるAI研究機関Google DeepMindが開発した動画生成モデルです。画像生成のImagen、音楽生成のLyriaと並ぶGoogleの生成AIモデルのひとつで、Googleの各種サービスの動画生成機能を支えています。
実際の使い方は、大きく分けて次の2つです。
- テキストから動画:「a drone shot over a foggy pine forest at sunrise, soft piano music」(朝日に照らされた霧の松林をドローンで空撮、柔らかなピアノ音楽)のようなプロンプトを書くと、Veoがその映像を生成します。
- 画像から動画:静止画、商品写真、キャラクター画像、あるいは最初と最後のフレームをアップロードすると、Veoがそれを動かしてくれます。
技術的には、Veoは拡散モデル(ディフュージョンモデル)と呼ばれるタイプのAIです。ノイズの状態から少しずつノイズを取り除き、プロンプトに合ったフレームに仕上げていきます。その過程で、動きやライティング、物理的な挙動がフレーム間で破綻しないように整えます。Veo 3からは音声も同時に生成されるようになったため、ドアがバタンと閉まる音はちょうどいいタイミングで鳴り、キャラクターの口の動きもセリフにぴったり合います。
Veo 3とは?
Veo 3は、2025年5月のGoogle I/Oで発表された第3世代のモデルです。映像と同期した音声をモデル自体で生成できる、初めての主要な動画モデルとして一気に話題になりました。しゃべるキャラクターや街頭インタビュー風の動画、本物と見分けがつかない架空のCMなどがSNSで拡散されたのです。「Veo 3」と検索して出てくる動画の多くは、このモデルかその後継モデルで作られたものです。
Veo 3.1とは?
Veo 3.1は現行のモデルです。Veo 3の音声生成はそのままに、映像制作者から要望の多かったコントロール機能が加わりました。キャラクターや商品の見た目を揃えるための最大3枚の参照画像、最初と最後のフレームの指定、長めのショットを作るためのシーン延長、縦型動画へのネイティブ対応、そして4K出力です。詳しくはVeo 3.1の紹介ページをご覧ください。
なお、名前は似ていますが、Veo Studio(useveo.ai)はVeoモデルを利用できる独立系のアプリです。Googleが開発したものではなく、Googleとの提携関係もありません。
Veoのバージョン一覧:初代VeoからVeo 3.1 Liteまで
Veoは驚くほどのペースで進化しており、2年足らずで6回もリリースを重ねてきました。しかもそのたびに、前のバージョンで最も不満の多かった点が改善されています。
| リリース時期 | バージョン | 主な変更点 |
|---|---|---|
| 2024年5月 | Veo | Google I/O 2024で発表された初代モデル。1080pのクリップを生成でき、「タイムラプス」や「空撮」といった映像用語も理解。 |
| 2024年12月 | Veo 2 | ディテールがより鮮明になり、物理挙動や人物の動きも向上。解像度もアップ。2025年4月にGeminiアプリでも利用可能に。 |
| 2025年5月 | Veo 3 | ネイティブ音声に対応し、セリフ、効果音、環境音を映像と同時に生成。Googleの映像制作ツール「Flow」と同時にリリース。 |
| 2025年10月 | Veo 3.1、Veo 3.1 Fast | 音声の表現力とプロンプトへの忠実度が向上。参照画像(Ingredients to Video)、最初と最後のフレーム指定、シーン延長に対応。 |
| 2026年1月 | Veo 3.1アップデート | 参照画像からのキャラクターの一貫性が向上。9:16縦型のネイティブ出力、1080pと4Kの出力に対応。 |
| 2026年3月 | Veo 3.1 Lite | 大量生成向けの、最も安価で高速なグレード。720pと1080pに対応。 |
2026年5月には、会話しながら動画を編集できる別のマルチモーダルモデル「Gemini Omni」もリリースされました。ただし、これはVeoの後継ではなく、Veoと並ぶ別のモデルという位置づけです。Googleの動画生成専用のモデル・APIは、引き続きVeo 3.1です。
Veoでできること
Veo 3.1は、偶然できた映像ではなく、狙いどおりのショットを作るためのモデルです。ここでは、日々の制作で特に役立つ機能を紹介します。
ネイティブ音声とセリフ
Veoは映像と一緒に音声も生成します。セリフを引用符で囲めばキャラクターがそれを話し、口の動きもちゃんと合います。「rain on a tin roof」(トタン屋根を打つ雨音)や「distant sirens」(遠くのサイレン)のように音を描写すれば、映像とタイミングを合わせて鳴らしてくれます。SNS向けや広告向けのコンテンツなら、ほとんどの場合、ナレーション収録やサウンドデザインを別工程で用意する必要はありません。
テキストから動画、画像から動画
動画はプロンプトだけでも作れます。画像を追加すると、Veoはそれを最初のフレームとして、あるいは目指すルックの手本として使います。商品動画の多くはこの方法で作られています。商品写真を入れると、360度回転するターンテーブル映像や、生活シーンの中で商品を見せるカットが出来上がります。
参照画像(Ingredients to Video)
人物、モノ、スタイルの画像を最大3枚渡すと、Veoはクリップ全体を通してそれらの見た目を一貫させます。Veo Studioでは、「@[image1] wears @[image2]'s jacket」(@[image1]が@[image2]のジャケットを着ている)のようにプロンプト内で画像をタグ付けします。AI動画でいえば、キャスティングと衣装合わせに最も近い機能です。
最初と最後のフレーム
開始画像と終了画像を指定すると、その間の動きを音声も含めてVeoが生成します。トランジションや変身シーン、何かをパッと見せるリビール演出にうってつけです。
シーン延長
1回で生成できる動画は短いものの、完成したクリップを延長できます。Veoはクリップの最後の1秒から続きを生成し、世界観、キャラクター、サウンドの一貫性を保ちます。Veo Studioでは1ステップごとに7秒ずつ追加でき、最大約148秒の連続した動画にできます。
映画的なカメラワーク
Veoは映像の専門用語を理解します。ドリーイン、クレーンショット、ラックフォーカス、浅い被写界深度、ゴールデンアワー、35mmフィルムの粒子感などです。撮影監督のように細かく指示するほど、思いどおりの映像に近づきます。こうした用語はVeo 3プロンプトガイドで詳しく解説しています。
公開先に合わせたフォーマット
クリップはYouTubeや広告向けの16:9、またはTikTok、Instagramリール、YouTubeショート向けの9:16で出力でき、解像度は720p、1080p、4Kから選べます。
Veo 3.1・Veo 3.1 Fast・Veo 3.1 Lite・Veo 3の違い
仕上げのショットにはVeo 3.1、下書きやほとんどのSNS用コンテンツにはFast、とにかく低コストで量をこなしたいときはLiteを選びましょう。Veo 3も引き続き利用できますが、すでに後継モデルに置き換わっています。
| モデル | 最大解像度 | 生成速度 | ネイティブ音声 | おすすめの用途 |
|---|---|---|---|---|
| Veo 3.1 | 4K | 最も遅い | あり | メインカット、広告、セリフのあるシーンなど、最終版の制作全般 |
| Veo 3.1 Fast | 4K | 速い | あり | アイデアの試行錯誤、SNS動画、日常的な制作のほとんど |
| Veo 3.1 Lite | 1080p | 速い | あり | 大量の下書き、Bロール、低コストでのプロンプトテスト |
| Veo 3 | 1080p | 普通 | あり | Veo 3で作った過去のプロジェクトとテイストを揃えたいとき |
| Veo 3 Fast | 1080p | 速い | あり | Veo 3風の下書きをすばやく作りたいとき |
3.1系のモデルは、16:9または9:16で4秒・6秒・8秒のクリップを生成します。シーン延長などの高度な機能は3.1系のモデル専用なので、特に理由がなければ3.1から始めるのがおすすめです。Veo Studioでは、すべてのアカウントでVeo 3.1がデフォルトになっており、プロンプト入力欄からモデルを切り替えられます。
Veoはどこで使える?
Veoは、Googleの単体アプリとして提供されているわけではありません。次のいずれかの入口から利用します。
| 利用先 | 向いている人 | 料金体系 |
|---|---|---|
| Geminiアプリ | すでにGoogleのサービスを使っているライトユーザー | Google AIのサブスクリプション(1日または1か月あたりの上限あり) |
| Google Flow | タイムラインやシーン機能を使いたい映像制作者 | Google AIプランに含まれる毎月のFlowクレジット |
| Gemini API、Google AI Studio | 自分のアプリにVeoを組み込みたい開発者 | 生成した動画の秒数に応じた従量課金 |
| Vertex AI(Google Cloud) | Google Cloudを契約している企業 | 生成した動画の秒数に応じた従量課金 |
| Veo Studioなどのサードパーティアプリ | シンプルなプロンプト入力欄で手軽に作りたいクリエイターやマーケター | 無料プラン、月額プラン、買い切りのクレジットパック |
自社のプロダクトにVeoを組み込みたい開発者は、Veo 3 APIのページから始めることもできます。
Veoは無料で使える?
Veoは無料で試せますが、本格的に使い込むなら無料の範囲では足りません。動画生成はそれだけコストがかかるからです。Google公式のGemini APIでは、Veo 3.1の料金はグレードと解像度に応じて動画1秒あたり0.05〜0.60ドル。つまり、8秒のクリップ1本で0.40〜4.80ドルかかる計算です。
無料で使う方法は次のとおりです。
- Veo Studioの無料プラン:毎月160クレジットが付与され、720pの動画を最大2本まで作れます。カード登録不要で、ウォーターマークも追加されません。Veo 3を無料で試す
- Googleのトライアル:Googleは、GeminiやFlowで回数限定のVeo生成を提供することがあります。また、Google AIの新規登録者には1か月の無料トライアルが用意されていることもよくあります。内容は頻繁に変わるため、最新の提供内容はGoogleで確認してください。
継続的に使う場合、Veo Studioの有料プランは月額14ドル(最大50本)からで、商用ライセンスつきです。全プランと、有効期限のない買い切りクレジットパックについては料金ページをご覧ください。
VeoとSora 2など他の動画生成AIを比較
Veo 3.1の強みはコントロール性です。4K出力、ネイティブ音声、参照画像、シーン延長がひとつのモデルにそろっています。ただし競合モデルにもそれぞれ得意分野があるため、どれを選ぶべきかは作りたいショット次第です。
| モデル | 開発元 | 強み |
|---|---|---|
| Veo 3.1 | Google DeepMind | 映画的なカメラワーク、口の動きと同期したセリフ、4K、参照画像によるキャラクターの一貫性、シーン延長による長尺化 |
| Sora 2 | OpenAI | 単一クリップでの説得力ある物理表現、1回の生成で作れる尺の長さ、Sora 2を中心にしたSNSアプリ |
| Kling | Kuaishou(快手) | ダイナミックな動きやアクション、コストパフォーマンスの高さ |
| Seedance | ByteDance | 生成が速く、複数ショットでのストーリー表現に強い |
| Runway | Runway | 充実した編集ツールと、モデルを中心にしたクリエイティブツール一式 |
Veo 3とSora 2の比較:どちらも音声つきの動画を生成できます。プロンプトへの忠実さ、カメラワークの指示、セリフのあるシーンではVeoに軍配が上がることが多く、物理的に複雑なアクションをワンテイクで見せたい場合はSora 2が好まれる傾向があります。プロの制作チームでも、完成版にはVeo、試作には別のモデルと使い分けているケースが少なくありません。
この分野の勢力図は毎月のように変わります。この記事も含め、あらゆる比較は2026年10月時点のスナップショットとして参考にしてください。
Veoの弱点と注意点
Veoは非常に優秀ですが、苦手なことを知っておけばクレジットの無駄遣いを防げます。
- クリップが短い:1回の生成は最大8秒です。それより長い動画を作るには、シーンを延長するか、複数のクリップを編集でつなぐ必要があります。
- 画面上の文字:看板、ラベル、ロゴなどの文字は崩れることがあります。テキストはあとから編集ソフトで入れましょう。
- 複雑な物理表現:素早い手の動き、群衆、物体同士がすり抜けてしまうような場面では、まだ破綻することがあります。
- 成功率:納得のいく1本ができるまで、2〜4回は生成する前提で考えておきましょう。明確で具体的なプロンプトほど成功率は上がります。
- コンテンツの制限:Googleの安全フィルターにより、暴力的・露骨な内容や、一部の実在人物を扱う内容はブロックされます。はっきりした理由が示されないまま拒否されるプロンプトもあります。
SynthID:Veoの動画に埋め込まれる電子透かし
Veoで生成された動画にはすべて、Google DeepMindの電子透かし「SynthID」がピクセルレベルで埋め込まれています。目に見えない透かしなので映像の見た目は変わりませんが、対応ツールを使えばAIで生成されたクリップだと識別できます。Googleの一部のアプリでは目に見えるウォーターマークも追加されますが、Veo Studioでは追加されません。
Veo 4は出ている?
出ていません。2026年10月時点で、GoogleはVeo 4を発表しておらず、最新のVeoモデルはVeo 3.1です。Googleが直近で発表した動画関連のモデルであるGemini Omniは、新しいVeoではなく、Gemini内の別モデルとして2026年5月にリリースされました。状況が変わり次第、この記事を更新します。
Veoに関するよくある質問
Veoはどんな用途に使われていますか?
SNS動画、商品広告、ミュージックビデオ、ショートフィルム、解説動画のBロール、絵コンテなどに使われています。ネイティブ音声に対応しているので、セリフやナレーションが入る動画には特に向いています。
Veoを開発したのはどこですか?
VeoはGoogle DeepMindが開発しています。GoogleはGemini、Flow、Gemini API、Vertex AIを通じてVeoを提供しており、Veo Studioのようなサードパーティアプリからも利用できます。
Veo 3は無料で使えますか?
制限つきで無料で試せます。Veo Studioの無料プランなら、カード登録なしで720pの動画を月に最大2本作成できます。Googleも不定期でトライアルを実施しています。継続的に使うには、有料プランかAPIクレジットが必要です。
Veo 3とVeo 3.1の違いは何ですか?
Veo 3.1では、参照画像、最初と最後のフレームの指定、シーン延長、縦型動画へのネイティブ対応、4K出力が追加され、音声の質とプロンプトへの忠実度も向上しています。ネイティブ音声を初めて導入したのがVeo 3で、それをさらに磨き上げたのがVeo 3.1です。
Veoで作れる動画の長さは?
Veo 3.1のクリップ1本は、4秒、6秒、8秒のいずれかです。Veo Studioのシーン延長を使えば、ひとつの連続したシーンを最大約148秒まで伸ばせます。
Veoは音声も生成できますか?
はい。Veo 3以降は、音楽、効果音、環境音、セリフが映像と同時に生成され、動きに合わせて同期されます。
Veoで作った動画は商用利用できますか?
Veo Studioの有料プランなら可能です。すべての有料プランに商用ライセンスが含まれています。Google経由でVeoを使う場合は、ご利用中のGoogleプランの規約を確認してください。
さっそくVeoを試してみよう
Veoを理解するいちばんの近道は、実際に何か作ってみることです。Veo Studioの無料アカウントを作成してプロンプトを入力すれば、数分で音声つきの最初のクリップが完成します。続けて、操作の流れを一から解説したVeo 3の使い方と、すぐに使えるプロンプトを集めたVeo 3プロンプトガイドもあわせてご覧ください。
