最高の画像から動画へ変換するAIとは、写真の絵柄を崩さずに動かしてくれるAIです。当たり前に聞こえますが、多くの比較記事が飛ばしているのがまさにこの点です。テキストから動画へ変換するモデルは想像力で評価されますが、画像から動画へ変換するモデルは「抑制力」で評価されます。静止画を作った時点で、顔、商品、光、構図はすでに決まっています。モデルの仕事は、そのどれも描き直さずに、自然な動きだけを加えることです。
このガイドでは、10の選択肢を比較します。秒単位で使える6つの最新モデル(ByteDanceのSeedance 2.5とそのTurboティア、KuaishouのKling 3.0、AlibabaのWan 3.0とWan 2.6 Flash、GoogleのVeo 3.1とGemini Omni 1.1 Flash)と、あわせて検索される4つのコンシューマー向けアプリ(Runway、Luma、Pika、Hailuo)です。当社がホストしているモデルについて、以下の長さ、解像度、音声、終了フレームへの対応状況は、実際にサービスを動かしているモデル定義から取得しています。価格は、特記がない限り、2026年9月29日に確認した当社の価格マニフェストにある提供元の定価です。サードパーティアプリのプランは各社の公開価格ページで確認し、「2026年9月確認」と表記しています。ベンダー自身のページで数字を確認できなかった場合は、推測せずにその旨を書いています。

画像から動画へのワークフローを描いた編集用イラストです。特定製品のスクリーンショットではありません。
運営者の開示
このガイドはMakeInfluencer.aiが公開しており、ここで比較している7つのモデル(Seedance 2.5、Seedance 2.5 Turbo、Kling 3.0、Wan 3.0、Wan 2.6 Flash、Veo 3.1 Fast、Gemini Omni 1.1 Flash)を、スタジオとAPIでホストしています。これらのモデルを開発したのは当社ではなく、ByteDance、Kuaishou、Alibaba、Googleです。サードパーティアプリについては、公開ページの記載内容だけをもとに説明し、当社と競合する場合でも長所を紹介しています。この点を踏まえて推奨内容をお読みいただき、ページ末尾の「午後いっぱいのテスト」で、ご自身で確かめてください。
Sora 2について:OpenAIは2026年9月24日にVideos APIを終了したため、Sora 2とSora 2 Proは、このガイドのどこでも推奨していません。Sora 2を実務向けの画像から動画の選択肢として紹介している比較記事があれば、それはサービス終了前に書かれたものです。
結論から先に
時間がない方向けに、2026年9月時点の勢力図を整理します。
- 総合的な品質と制御性で最高: ByteDanceのSeedance 2.5。1回の生成で最長30秒、480pから4K、ネイティブ音声、開始フレームと終了フレームに対応。1秒あたりの価格も最も高くなります。
- Seedanceで試行錯誤するのに最適: Seedance 2.5 Turbo。同じ4〜30秒の範囲を720pまたは1080pで、1秒あたり$0.36〜$0.90の代わりに$0.20〜$0.22で生成できます。
- 音声つきで秒単価が最も安い: AlibabaのWan 3.0。2〜30秒、ネイティブ音声、終了フレーム制御に対応し、720pで1秒あたり$0.10です。
- 最も安く動きを試せる: AlibabaのWan 2.6 Flash。720p・音声なしで1秒あたり$0.025。静止画がうまく動くかどうかを、画像から動画へのスタジオで試すのに最も安い方法です。
- 短く演出したキャラクターショットに最適: KuaishouのKling 3.0。3・5・10・15秒の選択肢、ネガティブプロンプト、オプションのサウンドレイヤーがあります。
- 音つきの仕上がりのよい8秒クリップに最適: GoogleのVeo 3.1 Fast。720pまたは1080pで4・6・8秒。
- 最も安いドラフト用: GoogleのGemini Omni 1.1 Flash。360pで1秒あたり$0.03。良かったものを720p、1080p、4Kで再生成します。
- 独自モデルを軸にした最高の編集アプリ: Runway。Gen-4.5に、編集機能と無料のスターター枠を組み合わせています。
- マルチモデル型のサブスクで最高: LumaとPikaは、どちらも自社モデルに加えて、Seedance 2.5を含むサードパーティのモデルを再販しています。
- ダンスや表現力のある動きで試す価値あり: MiniMaxのHailuo。サイトでは現在、MiniMax H3モデルを前面に出しています。
画像から動画へ変換するAIの比較方法
このリストのツールは、どれも写真を動かせます。実際に差が出る点は、宣伝文句が示すほど多くないため、各サービスを次の6つの観点で評価しました。
- 同一性の維持。 顔、商品ラベル、ロゴが、最初のフレームから最後のフレームまで変わらないか。画像から動画において最も重要な性質であり、最もよく失敗する点でもあります。
- 動きの質。 手、布、髪の動きは物理的に自然か。カメラは実際のカメラのように動くか、それとも宙に浮くように動くか。
- 1回あたりの生成の長さ。 短いクリップは修正の手間が安く済みます。長いクリップは編集の手間を減らせますが、失敗したときのコストが大きくなります。
- 解像度とアスペクト比。 TikTok、Reels、Shortsなら9:16、YouTubeやWebなら16:9、フィードや商品ページなら1:1か4:5。
- 音声。 ネイティブ音声(環境音、足音、セリフ)は音づくりの手間を省けますが、その分の料金がかかり、結局差し替えることも多いです。
- 終了フレームの制御。 開始フレームと終了フレームの両方を指定すると、生成は運任せから補間に変わります。このカテゴリーで最も活用されていない機能です。
7つ目の軸が価格で、これが最も測りやすい指標です。最新モデルは出力の秒数で課金されるため、提供元の1秒あたりの定価と、代表的なクリップのコストを掲載しています。MakeInfluencer.aiでは、これらの価格をクレジットに換算し、生成のたびに正確なクレジット消費量を事前に表示します。料金表の全体は、AI動画モデル料金ガイドで確認できます。
画像から動画へ変換するAIの比較表
モデルの行は、2026年9月29日に確認した提供元の定価を使用しています(Kling 3.0とVeo 3.1 Fastの価格は、最終確認が2026年5月21日です)。アプリの行は、各社の価格ページにある最も安い有料プランで、2026年9月に確認しています。
| サービス | 提供元 | クリップの長さ(画像から動画) | 解像度 | 音声 | 終了フレーム | 価格 |
|---|---|---|---|---|---|---|
| Seedance 2.5 | ByteDance | 4〜30秒 | 480p、720p、1080p、4K | ネイティブ、初期設定でオン | 対応 | 1秒あたり$0.18 / $0.36 / $0.90 / $1.80 |
| Seedance 2.5 Turbo | ByteDance | 4〜30秒 | 720p、1080p | ネイティブ、初期設定でオン | 対応 | 1秒あたり$0.20 / $0.22 |
| Kling 3.0 StandardとPro | Kuaishou | 3・5・10・15秒 | StandardとProの各ティア | サウンドはオプション、1.5倍のコスト | 対応 | Standardは音声なしで1秒あたり$0.084、Proは音声なしで1秒あたり$0.112 |
| Wan 3.0 | Alibaba | 2〜30秒 | 480p、720p、1080p | ネイティブ、初期設定でオン | 対応 | 1秒あたり$0.05 / $0.10 / $0.20 |
| Wan 3.0 Prime | Alibaba | 2〜30秒 | 480p、720p、1080p | ネイティブ | 対応 | 1秒あたり$0.075 / $0.15 / $0.30 |
| Wan 2.6 Flash | Alibaba | 2〜15秒 | 720p、1080p | オプション、価格は2倍 | 非対応 | 720p・音声なしで1秒あたり$0.025 |
| Veo 3.1 Fast | 4・6・8秒 | 720p、1080p | オプション | 対応 | 音声なしで1秒あたり$0.10、音声ありで$0.15 | |
| Gemini Omni 1.1 Flash | 3〜10秒 | 360p、720p、1080p、4K | 常にオン | 対応 | 1秒あたり$0.03 / $0.10 / $0.15 / $0.30 | |
| Runway | Runway | モデルによる | モデルによる | モデルによる | モデルによる | 無料:125クレジット(1回限り)。Standardは月$15(年払いで月$12) |
| Luma | Luma AI | モデルによる | モデルによる | モデルによる | モデルによる | 無料プランの記載なし。Plusは月$30(年払いで月$25) |
| Pika | Pika | モデルによる | モデルによる | モデルによる | モデルによる | 無料プランはクレジットパックの購入のみ。Starterは月$10 |
| Hailuo | MiniMax | ホームページに記載なし | ホームページに記載なし | 記載なし | 記載なし | 確認時にベンダーのページでプランを読み取れず |
3つの傾向が目立ちます。1つ目は価格差の大きさです。5秒・720pのクリップは、Wan 2.6 Flashなら$0.125、Seedance 2.5なら$1.80で、同じ長さで14倍の開きがあります。2つ目は、1回の画像から動画の生成で30秒に届くのが、Seedance 2.5とWan 3.0だけという点です。3つ目は、コンシューマー向けアプリが他社のモデルを販売する動きが強まっていることです。LumaとPikaの価格ページはどちらもSeedance 2.5を掲載しており、Runwayは自社のGen-4.5と並べてSeedance 2.0とKling 3.0を掲載しています。アプリを選ぶことは、モデルを選ぶのと同じくらい、課金の仕組みとインターフェースを選ぶことでもあるのです。
1. Seedance 2.5(ByteDance):総合で最高
Seedance 2.5は、ショットの出来が重要なときに、当社がまず選ぶモデルです。画像から動画のモードでは、開始フレームとオプションの終了フレームを受け取り、1回で4〜30秒を生成し、480p、720p、1080p、4Kで出力します。ネイティブ音声は初期設定でオンです。アスペクト比は開始画像に従います。
このリストの中で最も優れているのは、長いクリップでも構図を保てる点です。人混みの通りをカメラに向かって歩いてくる人物を20秒撮るようなショットで、顔、ジャケット、背景が最後のフレームまで崩れずに残る可能性は、低価格モデルよりはるかに高くなります。長い画像から動画のクリップが崩れやすいのは、まさにこうした場面です。また、1つのプロンプトで指定した複数ステップの動作(「彼女はカップを手に取り、一口飲み、それを置いて、窓の外を見る」)も、ステップを混ぜこぜにせずにこなします。
価格。 提供元の定価は、480pで1秒あたり$0.18、720pで$0.36、1080pで$0.90、4Kで$1.80です。5秒・720pのクリップは$1.80、10秒・1080pのクリップは$9.00になります。Seedance 2.5は出力のみで課金されるため、音声による追加料金はありません。
参照画像。 Seedance 2.5は最大30枚の参照画像を受け付け、プロンプト内では@Image 1、@Image 2のように指定します。MakeInfluencer.aiでは、これらの参照画像はテキストから動画のパスで機能します。開始フレームをアップロードした場合は、開始フレーム(とオプションの終了フレーム)が同一性の基準になります。静止画がない新しいシーンにキャラクターを登場させたい場合は、まず参照画像を使ってそのシーンを生成するか、GPT Image 2.5で静止画を作ってから動かしてください。
弱い点。 コストです。1080pでは、ここで紹介するサービスの中で1秒あたりの価格が最も高く、定価のままプロンプトを何度も試すと、予算がすぐになくなります。また、複数のプロバイダーが、1080pと4Kのティアは、より低いネイティブ解像度からのアップスケールだと説明しているため、SNS向けの作業解像度は720pと考えるのが自然です。
向いている用途。 メインカット、長い1カット撮り、キャラクター中心のシーン、フルスクリーンで見られるあらゆる映像。Seedance 2.5 APIガイドでは、Video ExtendとTalking Avatarを含む、Seedance 2.5の5つのモード全部を取り上げています。
GPT Image 2.5で作成したストーリーボードのフレームから、Seedance 2.5 Turboの画像から動画で生成したクリップ。
2. Seedance 2.5 Turbo(ByteDance):Seedanceの品質でコスパ最高
Seedance 2.5 Turboは、標準モデルと同じ画像から動画のインターフェースを使います。開始フレーム、オプションの終了フレーム、4〜30秒、初期設定でオンのネイティブ音声です。違いは解像度(720pまたは1080pのみ)と価格で、720pで1秒あたり$0.20、1080pで$0.22です。1080pでは標準ティアの約4分の1になります。
実際のところ、ほとんどの人はSeedanceをTurboで使うべきです。すべてのアイデアを、Turboの720p・5秒でドラフトします。1回あたり$1.00かかります。動き、テンポ、同一性の維持が良好に見えたら、Turboで生成したものをそのまま採用するか(SNS向けなら十分なことが多いです)、最終的な長さで標準のSeedance 2.5に、採用したプロンプトを流し直します。
ドラフトしてから仕上げるワークフロー
画像から動画の予算は、試行錯誤に消えていきます。ショットが仕上がるまでに6回かかるなら、720p・5秒のTurboドラフト6本で$6.00です。1080p・10秒の標準Seedance 2.5を6回試せば$54.00かかります。ドラフトは安く、高いレンダリングは1回だけにしましょう。
向いている用途。 UGC風の広告、SNSクリップ、本数が必要なあらゆるプロジェクト。毎日投稿するスケジュールなら、当社が選ぶモデルです。
3. Kling 3.0(Kuaishou):短く演出したキャラクターショットに最適
Kling 3.0にはStandardとProの2つのティアがあり、MakeInfluencer.aiでは、開始フレームとオプションの終了フレームから、16:9、9:16、1:1で3・5・10・15秒を生成できます。画像から動画ではネガティブプロンプトも使えるため、特定のアーティファクト(「extra fingers, camera shake, text」など)を抑えるのに役立ちます。サウンドはオプションで、追加料金がかかります。
Klingの強みは、人物の演出された物理的な動きです。首を回す、髪を払う、手を上げて振る、一歩前に出る、といった動作です。また、参照動画の動きを静止画に移す専用のモーションコントロールツールの基盤になっているのも、このモデルファミリーです。言葉で説明するのではなく、特定のダンスやジェスチャーが必要なときは、こちらが適したツールです。
価格。 Standardは音声なしで1秒あたり$0.084、音声ありで$0.126、Proは音声なしで$0.112、音声ありで$0.168です(2026年5月21日確認)。5秒のStandardクリップは音声なしで$0.42。これにより、Kling 3.0 Standardは、Gemini Omniのドラフトティアと480pのWan 3.0に次いで、終了フレーム制御つきのモデルとして最も安くなります。
弱い点。 上限は15秒で、サウンドレイヤーはレンダリングにネイティブで含まれるのではなく追加料金です。Klingは、頼んでいない表現豊かな動きを足しがちで、長いクリップほどその傾向が強まるため、動きを抑えるよう明確に指示してください。
向いている用途。 キャラクターアニメーション、ファッションやビューティーのクリップ、短いSNSのループ動画。ショットの種類とプロンプトについては、Kling 3.0動画ガイドでさらに詳しく解説しています。
4. Wan 3.0(Alibaba):音声つきで秒単価が最も安い
Wan 3.0は、このリストの中で目立たないコスパの王者です。開始フレームとオプションの終了フレームから、480p、720p、1080pで2〜30秒を生成し、ネイティブ音声は初期設定でオンです。アスペクト比は、16:9、9:16、1:1、4:3、3:4から選べるほか、入力画像に合わせることもできます。
価格。 480pで1秒あたり$0.05、720pで$0.10、1080pで$0.20で、音声込みです。音声つきの10秒・720pクリップは$1.00。同じクリップを標準のSeedance 2.5で作ると$3.60です。Wan 3.0 Primeは、同じモデルをより高速なキューで動かすもの(待ち時間はおよそ半分)で、1秒あたり$0.075、$0.15、$0.30です。
弱い点。 激しいアクション、人が多いシーン、手のクローズアップといった難しいショットでは、Seedance 2.5よりも開始フレームからずれやすくなります。落ち着いた構図のよいショットなら差は小さく、複雑な振り付けでは差がはっきり出ます。
向いている用途。 予算を抑えた長尺クリップ、Bロール、商品のターンテーブル、話者映像の背景、10〜30秒のクリップを大量に必要とするあらゆるワークフロー。こうした理由から、MakeInfluencer.aiのスタジオではデフォルトの動画モデルになっています。Wanファミリーのプロンプトのパターンは、Wan AI動画ガイドで紹介しています。
5. Wan 2.6 Flash(Alibaba):画像から動画で最も安い
Wan 2.6 Flashは、画像から動画専用のティアです。720pまたは1080pで2〜15秒を生成し、オプションの音声生成と、出力を誘導するためのオプションの音声入力に対応しています。終了フレーム制御はありません。
価格。 720pで音声なしなら1秒あたり$0.025、音声ありなら$0.05、1080pでは$0.0375と$0.075です。5秒・720p・音声なしのクリップは**$0.125**で、標準のSeedance 2.5で同じクリップを作る場合の約14分の1です。
弱い点。 Flashモデルなので、難しいプロンプトではそれなりの出来になります。動きは単純で、細部は甘くなり、長いクリップでは早く一貫性が崩れます。静止画がそもそもうまく動くかを試す用途や、環境的な動き(そよ風に揺れる髪、カップから立ちのぼる湯気、ゆっくりしたプッシュイン)には優れていますが、複雑なアクションには向きません。
向いている用途。 動きのアイデアを安く試す、環境的な動きのクリップを大量に作る、上位モデルで長尺をレンダリングする前の短いドラフト。
無料で使えるおすすめの画像から動画AI
このカテゴリーでは「無料」の意味が3つあり、それぞれを分けて考える価値があります。
アカウント登録なしの無料。 MakeInfluencer.aiでは、動画の無料生成は提供していません。スタジオでのクリップ生成はすべてクレジットで行い、レンダリング前にコストが表示されます。アカウントなしで提供しているのは、AI画像ジェネレーターでの無料の画像プレビューです。当社独自のオープン画像モデルで動作し、訪問者ごとに1日の利用上限が小さく設けられています。動かす前提の静止画をドラフトするのには便利ですが、動画は生成されず、ここで比較している最新モデルのいずれでもありません。確認した範囲のアプリでは、アカウントなしで画像から動画を繰り返し生成できるものはありませんでした。
有料アプリの中の無料スタータークレジット。 Runwayの無料プランには、125クレジット(1回限り)と一部のモデルが含まれます(2026年9月確認)。Pikaは、毎月のクレジットがない$0プランを掲載しており、必要に応じてクレジットパックを購入し、出力にはウォーターマークが入りません(2026年9月確認)。Klingの公式アプリは、ログインしたユーザーに毎日の無料クレジットがあるとうたっています。無料枠の出力にはウォーターマークが入ると書かれていますが、1日の正確な付与量は確認したページに記載がなかったため、アプリで確かめてください。
大きなサブスクリプションの中の無料。 Googleは、GeminiアプリとFlowでVeoを提供しており、無料枠や試用枠は国とアカウントの種類によって異なります。Googleのページで、Veo 3.1の安定した無料枠は確認できなかったため、他所で見かけた具体的な数字は暫定的なものとして扱ってください。
多くの人にとって、自分の写真で画像から動画がうまくいくかを判断する、最も安く誠実な方法は、有料で短いドラフトを作ることです。Wan 2.6 Flashの4秒・720p・音声なしのクリップなら、定価で$0.10で、顔が保たれるか、モーションプロンプトが伝わるかを確認できます。そのうえで音声、長い尺、1080pが必要になったら、Wan 3.0かSeedance 2.5 Turboに移ってください。
テスト用クリップの実際のコスト
720pの4秒のドラフトクリップ2本は、Wan 2.6 Flashの定価で$0.20です。これは本番の予算ではなくテスト用と考えましょう。尺と解像度に料金を払う前に、安いドラフトで静止画とモーションプロンプトを検証してください。
6. Veo 3.1 Fast(Google):音つきの仕上がりのよい8秒クリップで最高
Veo 3.1 Fastは、開始フレームとオプションの終了フレームから、16:9または9:16で、720pまたは1080pの4・6・8秒を生成します。音声はオプションです。Veoの評価は仕上がりにあります。きれいなライティング、説得力のあるカメラワーク、よく同期した環境音とセリフです。セリフの書式については、Veo 3プロンプトガイドで解説しています。
価格。 どちらの解像度でも、音声なしで1秒あたり$0.10、音声ありで$0.15です(2026年5月21日確認)。音声つきの8秒・1080pのクリップは$1.20です。
弱い点。 上限は8秒で、30秒の1カット撮りはできません。正方形の形式もありません。また、Veoは、Seedanceに比べて開始フレームを自由に解釈しがちです。映画的な見た目にはそれが向いていますが、商品ラベルやキャラクターの顔をピクセル単位で忠実に保ちたい場合には向きません。
向いている用途。 音が重要で、8秒で足りる、短いシネマティックな場面、セリフ、広告のフック。
7. Gemini Omni 1.1 Flash(Google):ドラフト用ティアで最高
Gemini Omni 1.1 Flashは、16:9または9:16で、360p、720p、1080p、4Kの3〜10秒を生成し、同期した音声が常にオンで、補間用のオプションの終了フレームにも対応します。
価格。 360pで1秒あたり$0.03、720pで$0.10、1080pで$0.15、4Kで$0.30です。5秒・360pのドラフトは$0.15。音声つきでショットをプレビューするには、最も安い方法です。
弱い点。 最長は10秒で、音声をオフにできない(そのため音声なしのBロールで費用を抑えられない)うえ、360pは動きの確認専用で、公開には使えません。
向いている用途。 より高価なレンダリングに進む前の、動きとタイミングの素早いプレビュー。また、4Kで生成するとSeedance 2.5では1秒あたり6倍のコストがかかる、短い4Kクリップにも向いています。
8. Runway:自社モデルを軸にした最高の編集アプリ
Runwayが売っているのは、単一のモデルではなくクリエイティブスイートです。価格ページ(2026年9月確認)では、自社の動画モデルとしてGen-4.5とAleph 2.0を挙げ、加えてSeedance 2.0 Pro、Seedance 2.0 Fast、Kling 3.0も掲載しています。プランは次のとおりです。Freeは125クレジット(1回限り)と5GBのストレージ、Standardは月$15(年払いで月$12)で625クレジット、Proは月$35(年払いで月$28)で2,250クレジット、Maxは月$95(年払いで月$76)で9,500クレジットです。
強み。 成熟した編集機能、動画から動画へのツール、すでにRunwayで編集しているチーム向けの一貫したワークフロー。静止画を動かし、そのまま編集、延長、合成までを1つのアプリで済ませたいなら、Runwayが最も完成度の高いパッケージです。
弱い点。 クレジットから秒数への換算はモデルや設定によって変わるため、1クリップあたりのコストは、秒単位のモデル課金より読みにくくなります。確認時の価格ページには、Seedance 2.5ではなくSeedance 2.0が掲載されていました。
向いている用途。 生成とポストプロダクションを1か所で済ませたい、編集者や小規模スタジオ。
9. LumaとPika:マルチモデル型のサブスクリプション
Luma(2026年9月確認)の価格ページには、無料プランがありません。Plusは月$30(年払いで月$25)で10,000クレジット、Proは月$90(年払いで月$75)で40,000クレジット、Ultraは月$300(年払いで月$250)で150,000クレジットです。自社のRay3モデルのほか、Seedance 2.0と2.5、Kling 3.0、Veo 3.1、MiniMax H3、Gemini Omni Flashが掲載されています。Lumaの自社モデルは、雰囲気のある映画的な動きを得意としていることで長く知られています。
Pika(2026年9月確認)には、毎月のクレジットがないFreeプラン(クレジットパックのみ)、月$10で900クレジットのStarter、月$35で3,150クレジットと商用ライセンスが付くCreator、月$95からのFancyティアがあります。クレジットパックは1ドルあたり60クレジットで販売されています。ページには、利用可能なモデルとしてSeedance 2.5とWan 3.0が挙げられており、どのプランでも出力にウォーターマークは入らないと書かれています。
弱い点。 どちらも、複数のモデルを取りそろえたサブスクリプションのラッパーです。便利ですが、使わなくてもプランの料金がかかり、秒単位の価格設定から一歩遠ざかります。ほしいモデルと解像度が、選ぶティアに含まれているかを確認してください。価格ページには、モデルごとの解像度の上限は記載されていません。
向いている用途。 複数のモデルファミリーを、1つの月額料金と1つのインターフェースで使いたいクリエイター。
10. Hailuo(MiniMax):表現力のある動きなら試す価値あり
HailuoはMiniMaxのコンシューマー向け動画アプリです。2026年9月にホームページを確認したところ、MiniMax H3が前面に出ており、ダンスやミュージックビデオ風のエフェクトなど、写真から動画へのテンプレートが紹介されていました。サブスクリプションのページでは、読み取れるプランの詳細が表示されず、第三者による価格のまとめも互いに食い違っているため、ここでは価格を掲載していません。予算を組む前に、プランのページを直接ご確認ください。
向いている用途。 テンプレート主導の写真アニメーションと、エネルギッシュな人物の動きを試したい場合。LumaのページにもMiniMax H3が掲載されており、こちらも試す方法の1つです。
ランク付けしなかったその他のアプリ
Higgsfieldは、自社の画像から動画モデルDoPに加え、Seedance 2.5、Kling 3.0、Wan 3.0を再販している大規模なマルチモデルプラットフォームで、2026年9月に公開APIを開始しました。プラン価格は情報源によってまちまちで、確認した日には価格ページから読み取れなかったため、Higgsfield代替ガイドで別に取り上げています。Adobe、Canva、CapCutも、より幅広い編集スイートの中に画像から動画の機能を備えています。すでに契約しているなら十分実用的ですが、ここで比較できるほど、クリップごとの制限を明確に公開しているところはありません。
画像から動画で効くモーションプロンプトの書き方
画像から動画で最もよくある間違いは、テキストから動画のプロンプトを書いてしまうことです。モデルにはすでにシーンが見えています。女性、赤いドレス、カフェ、夕暮れの光をまた説明すると、それらを描き直すように誘ってしまい、描き直しこそが同一性のずれの原因です。画像から動画のプロンプトでは、何が変わるか、カメラがどう動くか、何を変えてはいけないかを、この順番で書きます。

よいモーションプロンプトは、モデルにすでに見えているシーンではなく、変化、カメラ、制約を記述します。
主体の動き
速さを含めた、1〜2個の具体的な動作。「彼女はゆっくりカメラのほうへ首を向け、わずかに微笑む」のほうが、「彼女は自然に動く」よりも効果的です。
副次的な動き
主体の周りで動くもの:そよ風に揺れる髪、カップから立ちのぼる湯気、背景の木の葉、ピントの外で通り過ぎる車。
カメラ
カメラの指示は1つだけ:固定、ゆっくりしたプッシュイン、ゆっくりしたプルバック、わずかに揺れる手持ち、左へのオービット、ティルトアップ。2つの動きを同時に指定すると、たいてい浮いたような動きになります。
制約
変えてはいけないもの:顔、服装、構図を変えない。ラベルを読める状態に保つ。新しい人物をフレームに入れない。
以下は、当社が使っているモーションプロンプトを、用途別にまとめたものです。すでに被写体が入っている開始フレームを前提に書いているため、被写体の説明は繰り返していません。プロンプトは英語のまま貼り付けて使えます。
ポートレート、またはカメラに向かって話すクリエイター(UGCのフック)
Handheld phone-camera feel with subtle natural sway. She looks into the lens, raises her eyebrows slightly and begins to speak, gesturing once with her right hand. Hair moves slightly. Keep her face, outfit and the background unchanged. No zoom.
テーブルの上の商品(EC)
Static camera. The bottle rotates slowly clockwise on the marble surface, about a quarter turn over the full clip. Soft light glints across the glass as it turns. Keep the label sharp and readable and the background unchanged. No hands enter the frame.
周囲の動きがあるライフスタイルショット
Slow push-in toward the subject. Steam rises from the coffee cup, the curtain behind her moves gently in a breeze, and she lifts the cup and takes one sip. Everything else stays still. Keep her identity and the framing unchanged.
ファッションのウォーキング
The camera tracks backward at walking pace as she walks toward it on the sidewalk, arms moving naturally, coat hem swaying with each step. Background pedestrians move out of focus. Keep her face and outfit identical to the first frame.
ミュージックビデオのビート
Slow orbit to the left around the singer. Stage lights pulse and sweep behind her, haze drifts through the beams, and she tilts her head back on the beat. Keep her face and costume unchanged. No text or new people.
キャラクターアニメーション、落ち着いたアイドルループ
Static camera. The character breathes slowly, blinks once, and shifts her weight slightly from one foot to the other. Hair and fabric move gently. End on the same pose as the first frame. Keep the style and proportions unchanged.
アイドルループでは、終了フレームに対応しているモデル(Seedance 2.5、Kling 3.0、Wan 3.0、Veo 3.1 Fast、Gemini Omni 1.1 Flash)で、開始画像をもう一度終了フレームとして指定してください。ループがきれいにつながり、言葉で「シームレスなループ」を頼むよりはるかに確実です。
形容詞よりも速度を表す言葉が効く
「ゆっくり」「約4分の1回転」「1回だけ」「歩く速さで」のほうが、「シネマティック」「見事な」「美しい」よりも効果があります。画像から動画のモデルは、初期設定では動きすぎる傾向があり、動きをクリップの長さに見合った量に保つのは、こうした数量を表す言葉です。
開始フレームで勝負を決める
結果を左右するのは、プロンプトよりも開始フレームです。静止画を動かす前に、当社が必ず守っているルールを紹介します。
- 最終的なアスペクト比に合わせる。 縦型のクリップを作るなら、動かす前に9:16にトリミングします。足りない部分をモデルに補完(アウトペイント)させると、端に存在しない要素が作られ、作られた要素はずれていきます。
- 動きの余白を残す。 被写体が手を上げるなら、その手が動く場所が必要です。きつくトリミングした顔写真で「手を振る」動きを求めると、手が途切れたり、どこからともなく手が現れたりします。
- 手ははっきり見せるか、映さないか。 半分隠れた手は、歪みの原因として最も多いものです。全体を、力を抜いた状態で写すか、トリミングで外してください。
- やわらかい方向性のある光を選ぶ。 真昼の強い光や、色温度が混在した光は、動いている顔をモデルが再ライティングするときにちらつきやすくなります。
- 文字は最小限に。 ラベルや看板は、大きく、カメラに正対して平らで、数が少ないほど、動きの中でも崩れにくくなります。
静止画も自分で生成する場合、実写風の開始フレームには、構図の指示に忠実に従うGPT Image 2.5が当社の標準です。動かす前に、一連の静止画で同じ人物を保つ方法はキャラクター一貫性ガイドで、複数ショットの作品に向けて開始フレームと終了フレームの並びを計画する方法はストーリーボードからフィルムへのワークフローで紹介しています。
用途別:画像から動画AIの選び方
ランキングだけでは限界があります。適したモデルは、そのクリップの用途によって変わります。ここでは、よく相談される4つの用途について、当社ならこう選ぶという例を紹介します。
UGC広告
おすすめ: Seedance 2.5 Turbo、720p、9:16、5〜10秒、ドラフトでは音声オン。
UGC広告には、信じられる人物、最初の2秒で引き込むフック、そして本数が必要です。同じコンセプトのバリエーションを何本も試すことになるからです。Turboは720pで1秒あたり$0.20なので、10秒のバリエーションは$2.00で作れ、スマホの画面サイズで見るには十分な精度で顔を保てます。広告にセリフがあるなら、画像から動画で映像を生成し、リップシンクツールで音声を足せば、台本を正確に管理できます。フック、台本、開示のルールはAI UGC広告ガイドで、広告用の静止画を登録なしで作り始めるならAI広告ジェネレーターが便利です。
予算重視の代替案: Wan 3.0、720p、音声つきの10秒で$1.00。
商品ショット
おすすめ: 開始フレームと終了フレームを指定した、Wan 3.0またはSeedance 2.5 Turbo。
商品クリップは、ラベルの出来で決まります。固定カメラかゆっくりしたオービット、4分の1回転の回転、最終アングルの商品を映した終了フレームを使うと、パッケージの裏側をモデルが創作するのではなく、補間してくれます。クリップは4〜6秒にとどめましょう。回転が長いと、モデルが文字を描き直す機会が増えます。ランディングページのメインビジュアルには、採用した候補を標準のSeedance 2.5の1080pで流し直してください。
キャラクターアニメーション
おすすめ: 短く演出した動作にはKling 3.0、長い1カット撮りにはSeedance 2.5。
一貫したAIキャラクターにとって、同一性の維持が仕事のすべてです。Kling 3.0は、5〜10秒の1つの意図的な動作に強く、ネガティブプロンプトが繰り返し出るアーティファクトの抑制に役立ちます。15〜30秒の1カット撮りでは、Seedance 2.5のほうが顔を確実に保てます。特定の振り付けの動きが必要なら、言葉で説明するのではなく、参照動画を使ったモーションコントロールを使ってください。キャラクター自体の作り方は、写真からAIインフルエンサーを作るガイドで紹介しています。
ミュージックビデオ
おすすめ: 15〜30秒のショットにはSeedance 2.5かWan 3.0を、音声なしで生成し、あとから曲に合わせてカットする。
ミュージックビデオのショットのネイティブ音声は、使い捨てと考えてください。曲に差し替えるので、オフにできるモデルではオフにし、テイクを判断するときも気にしないことです。作品を、開始フレームの連なりとして設計し、各ショットを音楽のフレーズの長さで生成し、編集ソフトでビートに合わせてカットします。Wan 3.0なら720pで1秒あたり$0.10なので、1ショット10秒×20ショットの動画でも、やり直し前の生成費用は$20です。当社のAIミュージックビデオジェネレーターのページは、このワークフローを前提に作られています。
よくある失敗パターンと直し方
このリストのどのモデルも、同じ数パターンで失敗します。失敗の種類が分かれば、どこを調整すればよいかも分かります。

クリップが崩れる最初のフレームに印をつけましょう。そのフレームを見れば、プロンプト、開始画像、長さのどれを変えるべきかが分かります。
同一性のずれ
症状。 最後の1秒の顔が、最初のフレームとわずかに別人になる。あごのライン、目の形、生え際が、たいていは首を回したあとに少しずつずれていく。
対処法。
- プロンプトから外見を表す言葉を取り除きます。人物を描写すると、モデルが描き直してしまいます。
- 「Keep her face identical to the first frame.」のような明確な制約を加えます。
- クリップを短くします。ずれは時間とともに蓄積するため、8秒のクリップ2本をつなぐほうが、16秒のクリップ1本より良いことが多いです。
- 同じ人物の終了フレームを指定します。両端を固定すれば、モデルがさまよう余地がはるかに小さくなります。
- 首の回転を減らします。約45度を超える回転では、見えていない側の顔をモデルが創作せざるをえません。
- ティアを上げます。難しいショットでは、Seedance 2.5のほうが低価格モデルより同一性をよく保ちます。
歪む手と物体
症状。 指がくっつく、増える、あり得ない曲がり方をする。カップが手に溶け込む。アクセサリーの形が変わる。
対処法。
- まず開始フレームを直します。部分的に隠れた手、重なった手、フレームの端にある手が、よくある原因です。
- 手には単純な仕事を1つだけ与えます。「話しながら身振りをして髪を直す」ではなく、「カップを持ち上げて一口飲む」のようにします。
- Kling 3.0では、ネガティブプロンプトを加えます。「extra fingers, fused fingers, deformed hands」。
- 動作を遅くします。手の動きが速いと、モーションブラーと歪みが生じます。
- 手がショットに不要なら、開始フレームでトリミングして外します。
動きすぎ
症状。 すべてが一度に動く。カメラが急に舞い上がる、笑顔を頼んだのに被写体が踊る、背景が波打つ。映像というより、AIのデモのように見える。
対処法。
- カメラの指示は1つだけにするか、「static camera」とします。
- 「slowly」「once」「slightly」「a quarter turn」のように、量を表す言葉を加えます。
- 動かないものを明示します。「everything else remains still」。
- 長さを動作に合わせます。笑顔1回に10秒は不要で、余った時間をモデルが余計な動きで埋めます。4〜5秒にしましょう。
- プロンプトの自動拡張がある場合はオフにします。MakeInfluencer.aiでは、Wan 3.0で初期設定がオフになっており、プロンプトがより騒がしい内容に書き換えられません。
ほぼ動かない、固まった出力
症状。 逆の問題です。クリップがわずかにズームするだけの静止画になる。
対処法。 具体的な動作の動詞と、副次的な動きの源(「steam rises」「hair moves in the wind」)を与えます。制約だけのプロンプトは避けましょう。あるモデルで特定の画像が必ず固まる場合は、別のモデルを試してください。フラットなグラフィックや極端に狭いトリミングなど、モデルが動かせる要素を持たない静止画もあります。
ラベルと文字の崩れ
症状。 商品ラベルがぼやける、文字が入れ替わる、回転中にロゴがにじむ。
対処法。 回転は小さくとどめ、開始フレームと終了フレームの両方でラベルをカメラに向け、クリップは4〜6秒にし、最終版は1080pでレンダリングします。クリップはほぼ完璧なのにラベルだけが揺れる場合は、再生成するより、編集で元のラベルを合成し直すほうが速いことがよくあります。
合わない音声
症状。 ネイティブ音声が、望んでいない音楽、雑踏、話し声を加えてしまう。
対処法。 ほしい音をプロンプトに書く(「quiet room tone, a single cup set down on the table」)か、オフにできるモデル(Seedance 2.5、Wan 3.0、Wan 2.6 Flash、Kling 3.0、Veo 3.1 Fast)では音声をオフにして、編集で音を足してください。Gemini Omni 1.1 Flashは、常に音声を生成します。
決める前に、午後いっぱいでテストする
ランキングは出発点にすぎません。勝者を決めるのは、あなたの静止画、被写体、公開先のプラットフォームです。このテストにかかる時間は約2時間、費用は数ドルです。
- 実際の仕事を代表する静止画を3枚選ぶ。 人物1枚、商品1枚、広めのシーン1枚。それぞれ、公開するアスペクト比にトリミングします。
- 静止画ごとにモーションプロンプトを1つ書く。 上で紹介した4要素の構造で書きます。
- 各静止画を、3つのモデルに720p・5秒で通す。 低価格帯から1つ(Wan 2.6 FlashかWan 3.0)、中価格帯から1つ(Seedance 2.5 TurboかKling 3.0 Standard)、上位から1つ(Seedance 2.5かVeo 3.1 Fast)を選びます。低価格帯は、まず画像から動画スタジオで試しましょう。動きを比べる最も安い方法です。
- 各クリップを3つの観点で採点する。 同一性の維持(最後のフレームが最初と一致するか)、動きの質(手、布、カメラ)、実用性(公開できるか)。
- コストを、使えるクリップの数で割る。 2倍高くても、使える確率が2倍高いモデルなら、公開できる1本あたりのコストは同じです。
- 勝ったモデルで、最良のプロンプトをもう一度実行する。 1回だけの当たりより、再現性のほうが重要です。
MakeInfluencer.aiでは、このテストのすべてを1か所で実行できます。AI動画ジェネレーターにはこのガイドのすべてのモデルがそろっており、レンダリング前にクレジットコストを表示し、プロンプトを履歴に残します。開発者は同じ比較をAPIで実行でき、各モデルは1回のPOSTリクエストで動きます。手順は画像から動画へのAPIガイドで解説しています。
よくある質問
2026年に最高の画像から動画AIはどれですか?
総合的な品質と制御性なら、ByteDanceのSeedance 2.5です。4〜30秒、最大4K、ネイティブ音声、開始フレームと終了フレームに対応しています。日常的な作業のほとんどでは、Seedance 2.5 Turboが、720pまたは1080pで1秒あたり$0.20〜$0.22と、近い結果を出します。音声つきで秒単価が最も安いのは、720pで1秒あたり$0.10のAlibaba Wan 3.0です。
無料で使える最高の画像から動画AIはどれですか?
MakeInfluencer.aiは、動画の無料生成を提供していません。スタジオはクレジットで動き、最も安いドラフトは、720p・音声なしで1秒あたり$0.025のAlibaba Wan 2.6 Flashです。開始フレームは、アカウント不要のAI画像ジェネレーターで無料で下書きできます。アプリでは、Runwayの無料プランに125クレジット(1回限り)が含まれ、Klingのアプリでは、ウォーターマークつきの出力で毎日の無料クレジットが提供されます(どちらも2026年9月確認)。
実在の人物の写真をアニメーション化できますか?
技術的には可能で、ほとんどのツールが対応しています。やってよいかどうかは、本人の同意とプラットフォームのルールによります。同意した人物の写真だけを動かし、実在の人物の合成映像を本物として提示することは決してせず、公開先のプラットフォームの開示ルールに従ってください。当社のスタジオでも、アップロードされた画像の審査を行い、動かせない画像は拒否します。
顔を最も一貫して保てる画像から動画AIはどれですか?
長いクリップでは、一般にSeedance 2.5が同一性を最もよく保ち、短く演出したショットではKling 3.0がそれに続きます。どのモデルでも、プロンプトで人物を描写するのをやめ、クリップを短くし、終了フレームを固定すると、同一性の維持は最も改善します。
画像から動画のクリップは、最長でどれくらいですか?
Seedance 2.5、Seedance 2.5 Turbo、Wan 3.0は、1回の生成で30秒に届きます。Kling 3.0とWan 2.6 Flashは15秒、Gemini Omni 1.1 Flashは10秒、Veo 3.1 Fastは8秒です。Seedance 2.5のVideo Extendを使えば、1回の生成を超えてクリップを延長できます。
画像から動画AIの料金はいくらですか?
提供元の定価では、5秒・720pのクリップは、$0.125(Wan 2.6 Flash、音声なし)から、$0.42(Kling 3.0 Standard、音声なし)、$0.50(音声つきのWan 3.0)、$1.00(Seedance 2.5 Turbo)を経て、$1.80(Seedance 2.5)までの幅があります。完全な表はAI動画モデル料金ガイドにあります。
Sora 2は、画像から動画の選択肢としてまだ使えますか?
いいえ。OpenAIは2026年9月24日に、Sora Videos APIを終了しました。代わりに、Seedance 2.5、Veo 3.1 Fast、Wan 3.0を使ってください。
画像から動画とテキストから動画の違いは何ですか?
テキストから動画は、言葉からシーン全体を作り出します。画像から動画は、あなたの画像から始まるため、被写体、構図、光を正確にコントロールでき、モデルが加えるのは動きだけです。だからこそ、一貫したキャラクターや商品には、画像から動画が標準的なワークフローになります。見た目を静止画で固め、それから動かすのです。
終了フレームは必要ですか?
必須ではありませんが、最も確実な制御手段です。終了フレームを指定すると、生成が2枚の既知の画像の間の補間になり、ずれが減り、動きすぎが抑えられ、ループも作れるようになります。Seedance 2.5、Kling 3.0、Wan 3.0、Veo 3.1 Fast、Gemini Omni 1.1 Flashはいずれも対応しており、Wan 2.6 Flashは非対応です。
どのアスペクト比を使うべきですか?
公開する比率を使い、動かす前に開始フレームをその比率にトリミングしてください。TikTok、Reels、Shortsなら9:16、YouTubeやWebなら16:9、フィードなら1:1です。Veo 3.1 FastとGemini Omni 1.1 Flashは、16:9と9:16のみです。
まとめ
2026年に、ほとんどの人にとって最高の画像から動画AIは、1つのモデルではなく、「安く試してから、ショットに合うモデルで1回だけレンダリングする」という2段階の習慣です。まず、無料のAI画像ジェネレーターで静止画を下書きし、画像から動画スタジオで安いWan 2.6 Flashのクリップを作って動くかを確認し、Seedance 2.5 TurboかWan 3.0でドラフトを作り、作品の要になるクリップにだけ標準のSeedance 2.5やVeo 3.1 Fastを使います。最新のプランは料金ページに、各モデルの秒単価は料金ガイドにあります。特定のワークフローについてのご質問は、[email protected]までお寄せください。
モデルの機能とプロバイダーの定価は、2026年9月29日時点のMakeInfluencer.aiのモデルレジストリと価格マニフェストから読み取っています(Kling 3.0とVeo 3.1 Fastの価格は、最終確認が2026年5月21日です)。Runway、Luma、Pikaのプランは各社の公開価格ページから読み取り、2026年9月確認と表記しています。ベンダーのページで確認できなかったKlingアプリ、Hailuo、Googleの数値は、未確認と明記しています。このガイドは、ByteDance、Kuaishou、Alibaba、Google、Runway、Luma AI、Pika、MiniMaxとは提携していません。