要点(30秒で): フロンティアAIに予算を渡し、音楽ビデオを丸ごと自動で作らせる実験が公開された。差がついたのは推論の賢さではなく、裏で呼ぶ動画生成モデルの当たり外れと、自分の成果物を見直す力の欠如だった。エージェントに創作を任せるなら、まず「自己レビューさせる仕組み」を疑ってほしい。
AIに絵を1枚描かせるのはもう当たり前になった。では、3〜4分の音楽ビデオを「監督」として丸ごと任せたらどうなるのか。
海外のAI検証サイト TryAI が、ちょうどその実験を公開した。主役は今もっとも賢いとされる2つのモデル、Anthropicの Claude Fable 5 とOpenAIの GPT-5.6 Sol。両者に同じ課題と予算を渡し、人手ゼロで一本のMVを完成させられるかを競わせている。
結果を先に言うと、どちらも「圧倒された」出来ではなかった。だが失敗の中身が、いまのAIエージェントの弱点をきれいに映していて面白い。
何を競わせたのか
課題はBruno MarsとMark Ronsonの「Uptown Funk」。各モデルに渡されたのは、楽曲ファイルと短いテキスト説明、そして歌詞のタイムスタンプ付き書き起こしの3点セットだ。
与えた道具はエージェントらしい構成になっている。計画を立てるplan、生成モデルを調べるweb_search、残額を確認するget_budget、そして課金の発生するgenerate_imageとgenerate_video。加えてローカルシェルのrun_commandで、ffmpegやffprobeを使い音声を解析したり編集したりできる。
つまりモデルは自分で外部の動画生成モデルを選び、クリップを作り、映像を確認し、ffmpegで切り貼りして最終形に組み上げる。監督から編集まで全部AIという設定だ。
予算は$25と$100の2水準。2モデル×2予算で、合計4本が走った。

同じ課題に同じ予算——なのに4走行は作戦がバラけた。どのモデルを、どう組み合わせて使ったかの一覧
4本の走り方は見事にバラけた
面白いのは、同じ課題なのに各走行が別々のアプローチを取ったことだ。
Fable 5の$25版は、テキストから直接動画を作る素直な作戦で、生成モデルにWan 2.5を選んだ。Sol の$25版はひと工夫して、まずFLUXで静止画を作り、それをWan 2.2-5bで動かすハイブリッド方式を採った。
上位予算ではさらに分かれる。Solの$100版はWan 2.5、Veo 3.1 Lite、Hailuo 2.3の3つの動画モデルを混ぜて使った。対してFable 5の$100版は、Seedance 1.0 Proに絞って1080pで通した。
注目したいのは、全4走行がReplicateも使えたのにFALのモデルばかり選んだ点だ。選択肢はあったのに、AIたちは示し合わせたように同じ供給元へ寄っていった。

生成費はほぼ互角。差はトークン代に出て、総額はFableがSolの2〜5倍——賢さが同じでも請求書は別物
勝敗を分けたのは「頭脳」ではなかった
研究チームの総評は「Fable 5の$100版をわずかに好んだ」。ただし但し書きが付く。どれも圧倒されなかった、と。
そして勝敗の理由が示唆に富む。Fableが優れて見えたのは、推論がずば抜けていたからではなく、たまたま出力の破綻が少ない生成モデル(Seedance)を選んだからだった。逆にSolの$100版は、3モデルを混ぜた冒険が裏目に出て、明らかに低品質なクリップを何本か本番に混ぜてしまった。
言い換えれば、監督AIの賢さより、発注先の当たり外れが最終品質を左右した。これは動画に限らず、外部ツールを叩くエージェント全般に効いてくる論点だ。ツールを賢く使うより前に、良いツールを引けるかどうかで結果が決まってしまう。

予算を渡す前に足すべき2つの設計——「良い外部ツールを引く工夫」と「成果物を自分で採点させる仕組み」。下段は今回露呈した弱点
歌詞を真に受けすぎる
品質面での共通の弱点も見えた。どのモデルも歌詞をあまりに文字通りに解釈する。
象徴的なのが「Make a dragon wanna retire, man(ドラゴンも引退したくなるほどイケてる、の意)」という一節で、画面に本物のドラゴンが登場してしまった。比喩を映像の指示書として真に受けた格好だ。
キャラクターの一貫性も崩れた。クリップをまたぐと登場人物の見た目が変わり、通しで筋の通った物語になった走行はひとつもない。カットは拍に合っていても、クリップ内の動きと曲のテンポが噛み合わない場面が目立った。
いちばん痛かったのは「自己レビューの穴」
編集面ではSolの$25版が最も独創的だった。テキストのオーバーレイや、静止画に映像エフェクトを重ねるアニメ化など、他の走行が試さなかった手を打っている。低予算ほど工夫が出たのは示唆的だ。
だが全体を貫く最大の弱点は別にある。モデルたちはクリップを連結こそすれ、自分の映像を作り直したりエフェクトを足し直したりはほとんどしなかった。研究チームの言葉が刺さる——「どのモデルも、自分のクリップが本当に良いかを真剣に確かめなかった」。
しかも、どの走行も予算の上限近くまで使い切らず、重い試行錯誤にも踏み込まなかった。長期の創作タスクをやり抜く戦略的な視野が、まだ欠けているということだ。エージェントは手を動かせても、自分の成果物を突き放して見る目をまだ持っていない。
このあたりは、動画編集ソフトを「AIに運転させる」FableCutで見た「操作はできても判断はまだ人間頼み」という構図とも重なる。
トークン代の不思議な差
コスト面には、実務者が見逃せない数字が残った。生成にかかった費用は各走行で$23〜$49とおおむね近い。差がついたのはLLMのトークン代のほうだ。
Solのトークン代は$3〜$4に収まったのに、Fableは$17〜$25もかかった。トークンの量自体は大きく変わらないのに、この開きが出る。総額ではSolが$27〜$40、Fableが$41〜$74と、はっきり差がついた。
賢さが互角なら、同じ仕事の請求書が2〜5倍違うという事実は重い。エージェントを長時間走らせるほど、この地力の差は効いてくる。トークン消費の癖が価格を左右する構図は、Claude Codeは”読む前に”33kトークンで扱った論点と同じ根を持つ。
Hacker Newsは辛口だった
公開後、Hacker Newsでは評価が割れた。最も支持を集めたコメントは手厳しく、出来上がりを「あらゆる概念を平均した灰色のドロドロ」「芸術的価値ゼロ」と切り捨てた。才能ある人間なら午後半日で、しかも無料で、もっと良いものを作れるという指摘だ。
技術的な粗も名指しされた。フレーム間の不整合、音とズレたダンス、手足が不自然に変形するモーフィング、そして何より「動きのないゆっくりしたパン」がAI映像の署名のように全編に出る、と。
擁護派は別の角度から返した。安さと速さこそ進歩であり、明確なビジョンを持つ作り手が道具として使えば話は変わる、と。人間が作る動画だって9割は凡庸ではないか、という反論も出た。この温度差自体が、生成AIと創作をめぐる現在地をよく表している。
日本・個人開発の視点
この実験のいちばんの価値は、勝ち負けそのものより「再現できる形で公開された」ことにある。アリーナのコードはgithub.com/hershalb/music-video-arenaでオープンソース化されている。
つまり日本の個人開発者も、自分の予算とモデルで同じ土俵を組める。$100は日本円でおよそ1万5千円強。仕事を丸ごと任せて完成度を測るには、案外手が届く実験費だ。
そして得られる教訓は動画に限らない。エージェントに任せるときは、賢いモデルを選ぶこと以上に、良い外部ツールを引き当てる設計と、成果物を自分で採点させる仕組みが効く。この2点を欠いたまま予算だけ渡しても、AIは上限を使い切らずに凡庸な答えで満足してしまう。
要点まとめ
- TryAIがClaude Fable 5とGPT-5.6 Solに、予算$25と$100で「Uptown Funk」のMVを人手ゼロで自動監督させた(計4走行、コードはオープンソース)。
- 最終品質を左右したのはモデルの賢さより、裏で呼ぶ動画生成モデル(Seedance、Wan、Veo、Hailuoなど)の当たり外れだった。
- 4本とも歌詞を文字通り解釈し、キャラの一貫性と曲との同期に失敗。誰も自分のクリップを真剣に見直さなかった。
- トークン代はSolが$3〜4、Fableが$17〜25と大差。総額でもSolが安く、賢さが互角でも請求額は数倍違いうる。
- 研究チームの評価はFableのわずかリードだがHNは辛口。「灰色のドロドロ」という言葉が反応を象徴した。
🐦⬛ 編集部の視点
この記事、勝った負けたの見出しで読むと本質を外す。いちばん面白いのは「賢いはずのAIが、自分の作ったものを見直さなかった」という一点だ。
人間の編集者なら、書き上げた原稿を一度突き放して読み返す。ダサいカットは撮り直す。その当たり前の一手を、フロンティアモデルですらまだ自発的にはやらない。手は動くのに、批評眼が回っていない。ここに今のエージェントの天井がくっきり出ている。裏を返せば、ザッカーバーグ「AIエージェントは期待ほど進んでいない」という嘆きの正体も、案外この「自己レビューの穴」なのかもしれない。
あなたがエージェントに何かを任せるとき、成果物を採点させる工程は入っているだろうか。予算より先に、その一行を足すだけで結果は変わる気がしている。





コメントを残す