重要なお知らせ 「Forbes」の名称を使用した営業活動にご注意ください

AI

2026.10.11 08:48

AI動画は「モデルの存在」を意識させないほど進化している

Adobe Stock

Adobe Stock

生成AIによる動画制作のクオリティは日々向上しており、単に見栄えの良い動画を作成するだけでは不十分になりつつある。現在求められているのは、プロデューサー、監督、撮影監督、脚本家、カット作成者の役割をこなせるAI動画システムだ。こうした流れを受け、Kling AI(可霊AI)は最新動画モデル「Kling 4.0」のアーリーアクセス(早期利用)を開始した。同モデルは、ネイティブでの30秒生成、最大10個のキーフレーム対応、マルチモーダルな参照データ、ステレオ音声、そして最長2分までの動画延長機能を備えている。これは一見すると単なる技術的機能のリストに思えるかもしれないが、AI動画開発競争が「単にクリップを生成する段階」から「制作全体をコントロールする段階」へと移行していることを示している。

クリエイティブチームや広告代理店、企業にとって、この種のコントロール能力は不可欠だ。どれほど美しい数秒間のクリップであっても、次のカットで人物の姿が変わり、製品の形が歪み、ロゴが読めなくなったり、監督が特定の動きを再現できなかったりすれば、価値はほとんどない。企業が求めているのは、指示通りに機能し、修正指示にも対応でき、何世代も生成を繰り返してトークンと時間を無駄にすることなく、実用的な映像を生み出せる動画システムなのだ。

高品質な結果を出せるモデルが数多く存在するようになった今、市場のベンダーには重要な疑問が突きつけられている。AI動画システムが十分に高品質化し、互換性(代替可能性)を持つようになったとき、何が起きるのか。開発者が大規模言語モデル(LLM)を選ぶ際のように、ユーザーが特定ベンダーに固執せず、タスクごとに異なるモデルを自由に選ぶようになったらどうなるのだろうか。

生成プロセスの制御性を高めた「Kling」最新版

今週、Klingは近く提供予定の「4.0」のプレビューを公開した。これは業界の今後の進路を示唆している。リリース情報によると、ユーザーはモデルに参照画像や動画クリップ、被写体を読み込ませることで、キャラクターやシーンなどの要素を定義できる。また、生成した動画は最大2分まで延長可能だという。

このモデルは4Kおよび1080pで10ビットHDR出力を追加し、21:9フォーマットをサポートし、2チャンネルのステレオ音声を生成し、リップシンク(口の動きの同期)を改善する。Klingによると、カメラワークやシーン転換を挟んでも、多言語テキストや絵文字、ロゴの形状を維持できるという。一般公開は10月に予定されている。

テキストプロンプト(指示文)による生成は、解釈の大部分をモデルに委ねることになる。個人的な実験段階ではそれが面白いかもしれないが、クライアントが特定のシークエンス(一連の映像)を求め、修正を要求してくるビジネスの場ではコストが嵩む原因になる。キーフレームは、モデルが繋ぎ合わせるべき固定された視覚的瞬間を指定するものだ。クリエイターはいくつかの時点で表示すべき映像を決定し、その間の動きをAIに生成させることができる。映像を作るのは依然としてモデルだが、意図から逸脱する余地は少なくなる。

これは商業制作においてとりわけ重要である。そこでは創造上の自由が無制限であることはめったにない。販売される商品は実物通りに見える必要があり、登場人物には一貫性が求められる。広告の冒頭や終わりのカットが既に決まっていることもあり、モデルはその条件を尊重しなければならない。同様に、ブランドチームが定めるロゴ、タイポグラフィ、配色に関するルールも厳守する必要がある。

同様の課題解決に向けて急速に進化するAI動画市場

AI動画生成市場において、Klingと競合する企業は少なくない。ByteDance(バイトダンス)は7月31日に「Seedance 2.5」をリリースした。30秒の音声・動画生成、複数回の動画延長、より豊かな参照入力、編集コントロール機能を備える。ByteDanceによると、一度の生成で最大30枚の画像、10本の動画、10件の音声クリップを受け付けることができる。タイムスタンプ(時間軸)レベルの指示でコンテンツを編集でき、カメラアングルやグリーンバック(背景合成)作業、複雑な映像制作に向けた制御機能を提供する。

MiniMax(ミニマックス)も「H3」で同様のアプローチをとっている。7月31日にリリースされ、後にオープンウェイト(重み付けの公開)として提供されたH3は、テキスト、画像、動画、音声の文脈(コンテキスト)を入力とし、最大2K解像度、15秒長さのステレオ音声付き動画を生成する。MiniMaxはテキストのレンダリング(描画)やモーション転送に注力しており、広告、EC(電子商取引)、プロダクトデザイン、ブランディングなどの商用利用をターゲットにしている。

Runway(ランウェイ)の「Gen 4.5」は、カメラワーク、シーン構成、イベントのタイミングに関する詳細な指示を受け付ける。現在のテキストから動画(Text-to-Video)および画像から動画(Image-to-Video)モードでは、2〜10秒のシークエンスを生成できる。RunwayはGen 4.5の生成に対し、1秒あたり12クレジットを課金している。

グーグルの「Veo 3.1」は、参照データと一貫性を強く重視している。クリエイターは、シーン、オブジェクト、キャラクターを定義する画像を読み込ませたり、スタイルの参照データを与えたり、カメラのフレーミングや動きを制御したり、シーンを延長したり、最初と最後のフレームを指定してシークエンスをコントロールしたりできる。

実装方法はそれぞれ異なるものの、クリエイターや発注者は、以下のような同様の実用的な観点からこれらのモデルを評価し始めている。

「モデルはどれだけ長く一貫性を維持できるか」「どれほど忠実に指示に従うか」「キャラクターや製品の見た目を固定(アンカー)できるか」「シークエンスが複雑になったときにどうなるか」「実用的な映像を得るまでに何回の試行が必要か」

1つのプロジェクトで複数の動画モデルを使い分ける時代

1〜2年前であれば見栄えの良いデモ動画に誰もが感銘を受けたものだが、現在のデモは、モデルが最低限の適性を備えていることを証明する指標に過ぎない。

AIモデル市場のあらゆる分野と同様、急速なモデルの進化は、ベンダーにとって機会と課題の双方をもたらす。モデルの性能が上がれば向上するほど、別のモデルへの乗り換えが容易になるからだ。

例えば、あるモデルは人物の動きを極めてスムーズに描けるが、パッケージの文字描写が苦手だとしよう。別のモデルは製品撮影に優れているが、広告代理店がSNS用に300パターンのバリエーションを必要とする場合にはコストがかかりすぎる。さらに別のモデルは、複雑なカメラワークの表現を得意とする。複数のモデルを組み合わせることで最良の結果が得られるのであれば、なぜ1つのモデルだけに限定する必要があるだろうか。

こうしたマルチモデルのアプローチは、モデルの上位にあるソフトウェア層で既に進行している。アドビ(Adobe)は4月、「Adobe Firefly」に「Kling 3.0」および「Kling 3.0 Omni」を追加した。クリエイターに既存のワークフローを離れさせてKlingを直接使わせるのではなく、アドビの制作環境の中に外部モデルを取り入れたのだ。

旧Freepik(フリーピック)の「Magnific(マグニフィック)」も同様の方向性を推し進めている。同社のプロダクトは、多様な動画・画像生成モデルを利用する際、ユーザーが個別のモデルプロバイダーを行き来するのではなく、制作ワークフローを一箇所に集約させることに重点を置くようになっている。

Higgsfield(ヒッグスフィールド)の「Canvas」はさらに一歩進んでおり、複数のモデルを単一の視覚的ワークフローに組み込む(チェーン化する)ことができる。同社の動画ワークスペースでは、Kling、ByteDance、グーグル、OpenAI、アリババ(Alibaba)などのモデルを同一環境内で利用可能だ。APIドキュメントを使えば、プログラムによって静止画にはあるモデルを、動きには別のモデルを、ドラフト(下書き)作成には安価なエンジンを、最終出力には高性能なモデルを使うといった振り分けが可能になる。

クリエイティブチームは、自社がKling派か、Veo派か、あるいはSeedance派かを決める必要すらなくなるかもしれない。各工程で最も優れたパフォーマンスを発揮するモデルを選び、それらの出力をAdobe FireflyやMagnific、Higgsfieldといったプラットフォーム上で統合すればよいだけだからだ。

モデルのベンダーにとって、これは機会であり脅威でもある。こうしたプラットフォームを通じて流通することで、より多くのユーザーに自社モデルを使ってもらえるようになる。一方で、自社モデルが制作ワークフロー全体の基盤として選ばれるのではなく、特定のカットやタスクのために選ばれる「数ある選択肢の1つ」に過ぎなくなる恐れもある。

ユーザーがモデルプロバイダーのサービスを直接利用する場合、プロバイダーがユーザー体験と顧客関係を保持できる。しかし、複数のモデルが同一の制作環境内に並ぶようになると、モデルの存在感は単なる「付け替え可能なエンジン」に近づいていく。

この変化により、ベンダーは単に出力品質を追求するだけでなく、生成コストやスピード、出力の信頼性と一貫性、さらには精密な動作・指示制御といった能力の開発を迫られることになる。

細部へのこだわりが重視される動画生成は、画像やテキストの生成とは異なる。つまり、実用的なクリップを得るための「本当のコスト」は、何回の生成を繰り返さなければならないかによって決まる。モデルAがモデルBの2倍の単価(1秒あたり)であったとしても、モデルAが通常3回の試行で狙い通りのカットを出力できるのに対し、モデルBが15回を要するとしよう。そうなれば、単価の安いモデルBはもはや「安い」とは言えない。これにはプロンプトの作成や出力結果の確認にかかる時間すら含まれていないのだ。

この試行錯誤にかかる時間を短縮するため、Klingは頻繁な生成に対応した高速・低コストの選択肢として「Kling 4.0 Flash」を投入する。試行コストと時間を削減すべく、他社からも同様の小型・高速(Flash型)モデルが急速に増加することが予想される。

AI市場が成熟するにつれ、単にインパクトのあるデモを見せたり賢い出力を競ったりする段階から、映像制作のためのエンジンや統制システムの集合体へと移行しつつある。派手さよりも「いま現場で使えるか」が重視される、より現実的なAIの新フェーズへと我々は入りつつあるのだ。

(forbes.com 原文)

タグ:

advertisement

ForbesBrandVoice

人気記事