Die beste Foto-zu-Video-KI ist die, die dein Bild unverändert lässt, während es sich bewegt. Das klingt selbstverständlich, ist aber genau der Test, den die meisten Vergleiche auslassen. Ein Text-zu-Video-Modell wird an seiner Kreativität gemessen, ein Foto-zu-Video-Modell an seiner Zurückhaltung. Gesicht, Produkt, Licht und Bildausschnitt hast du schon festgelegt, als du das Standbild erstellt hast. Das Modell soll nur glaubwürdige Bewegung hinzufügen, ohne etwas davon neu zu zeichnen.
Dieser Leitfaden vergleicht zehn Optionen: sechs Spitzenmodelle, die du pro Sekunde abrechnen kannst (ByteDance Seedance 2.5 und seine Turbo-Stufe, Kuaishou Kling 3.0, Alibaba Wan 3.0 und Wan 2.6 Flash, Google Veo 3.1 und Google Gemini Omni 1.1 Flash), und vier Consumer-Apps, nach denen Leute daneben suchen (Runway, Luma, Pika und Hailuo). Bei den Modellen, die wir selbst hosten, stammen Dauer, Auflösung, Audio und End-Frame-Unterstützung aus den Modelldefinitionen, die das Produkt antreiben. Die Preise sind die Listenpreise der Anbieter aus unserem Preis-Manifest, geprüft am 29. September 2026, sofern nicht anders angegeben. Die Tarife der Apps von Drittanbietern haben wir auf den öffentlichen Preisseiten der Anbieter geprüft und mit „September 2026 geprüft“ gekennzeichnet. Wo wir eine Zahl auf der Seite des Anbieters nicht bestätigen konnten, sagen wir das, statt zu raten.

Redaktionelle Illustration des Foto-zu-Video-Workflows, kein Produkt-Screenshot.
Hinweis der Redaktion
MakeInfluencer.ai veröffentlicht diesen Leitfaden und hostet sieben der verglichenen Modelle (Seedance 2.5, Seedance 2.5 Turbo, Kling 3.0, Wan 3.0, Wan 2.6 Flash, Veo 3.1 Fast und Gemini Omni 1.1 Flash) in seinem Studio und seiner API. Wir entwickeln keines dieser Modelle selbst; sie stammen von ByteDance, Kuaishou, Alibaba und Google. Die Apps von Drittanbietern beschreiben wir nur anhand dessen, was ihre öffentlichen Seiten sagen, und wir nennen ihre Stärken auch dort, wo sie mit uns konkurrieren. Lies die Empfehlungen mit diesem Hintergrund und überprüfe sie mit dem Nachmittags-Test gegen Ende der Seite selbst.
Ein Hinweis zu Sora 2: OpenAI hat seine Video-API am 24. September 2026 eingestellt, deshalb empfehlen wir Sora 2 und Sora 2 Pro in diesem Leitfaden nirgends. Falls ein Vergleich, den du liest, Sora 2 noch als brauchbare Foto-zu-Video-Option führt, wurde er vor der Einstellung geschrieben.
Die kurze Antwort
Wenn du nur eine Minute hast, sieht die Lage im September 2026 so aus:
- Beste Gesamtqualität und Kontrolle: ByteDance Seedance 2.5. Bis zu 30 Sekunden pro Generierung, 480p bis 4K, natives Audio, Start- und End-Frames. Es ist pro Sekunde auch das teuerste Modell.
- Beste Möglichkeit, Seedance kostengünstig zu nutzen: Seedance 2.5 Turbo, derselbe Bereich von 4 bis 30 Sekunden bei 720p oder 1080p für 0,20 bis 0,22 Dollar pro Sekunde statt 0,36 bis 0,90.
- Bestes Preis-Leistungs-Verhältnis pro Sekunde mit Audio: Alibaba Wan 3.0. 2 bis 30 Sekunden, natives Audio, End-Frame-Kontrolle, 0,10 Dollar pro Sekunde bei 720p.
- Günstigste Bewegung: Alibaba Wan 2.6 Flash, 0,025 Dollar pro Sekunde bei 720p ohne Ton. Damit testest du am günstigsten, ob sich ein Standbild gut animieren lässt, im Foto-zu-Video-Studio.
- Am besten für kurze, gezielt geführte Character-Aufnahmen: Kuaishou Kling 3.0, mit Optionen für 3, 5, 10 und 15 Sekunden, negativen Prompts und optionaler Tonspur.
- Am besten für saubere 8-Sekunden-Clips mit Ton: Google Veo 3.1 Fast, 4, 6 oder 8 Sekunden bei 720p oder 1080p.
- Bester günstiger Entwurfsdurchlauf: Google Gemini Omni 1.1 Flash in 360p für 0,03 Dollar pro Sekunde, den Gewinner dann in 720p, 1080p oder 4K neu rendern.
- Beste Schnitt-App rund um ein eigenes Modell: Runway, das Gen-4.5 mit einem Editor und einem kostenlosen Startguthaben kombiniert.
- Beste Abos mit mehreren Modellen: Luma und Pika verkaufen inzwischen auch Modelle von Drittanbietern, darunter Seedance 2.5, neben ihren eigenen.
- Testenswert für Tanz und ausdrucksstarke Bewegung: Hailuo von MiniMax, dessen Website inzwischen mit dem Modell MiniMax H3 wirbt.
So haben wir Foto-zu-Video-KI verglichen
Jedes Tool auf dieser Liste kann ein Foto animieren. Die Unterschiede, auf die es in der Praxis ankommt, sind kleiner, als das Marketing vermuten lässt. Deshalb haben wir jede Option anhand von sechs Kriterien bewertet.
- Identitätstreue. Bleiben Gesicht, Produktetikett oder Logo vom ersten bis zum letzten Frame gleich? Das ist die wichtigste Eigenschaft bei Foto-zu-Video und zugleich die, an der es am häufigsten scheitert.
- Bewegungsqualität. Sind Hände, Stoffe und Haare physikalisch plausibel? Bewegt sich die Kamera wie eine Kamera, oder schwebt sie?
- Länge pro Generierung. Kurze Clips lassen sich günstig korrigieren. Lange Clips sparen Schnittzeit, machen aber jeden Fehlversuch teurer.
- Auflösung und Seitenverhältnis. 9:16 für TikTok, Reels und Shorts, 16:9 für YouTube und Web, 1:1 oder 4:5 für Feeds und Produktseiten.
- Audio. Natives Audio (Umgebungsgeräusche, Schritte, Dialog) erspart einen Sounddesign-Schritt, kostet aber Aufpreis, und oft ersetzt du es trotzdem.
- End-Frame-Kontrolle. Mit Start- und End-Frame wird aus einer Lotterie eine Interpolation. Diese Funktion wird in der Kategorie am seltensten genutzt.
Der Preis ist das siebte Kriterium und am leichtesten zu messen. Spitzenmodelle werden pro Sekunde Ausgabe abgerechnet, daher nennen wir den Listenpreis des Anbieters pro Sekunde und die Kosten für einen typischen Clip. MakeInfluencer.ai rechnet diese Preise in Credits um und zeigt die genauen Credit-Kosten vor jeder Generierung; die vollständige Preistabelle steht im Leitfaden zu KI-Video-Modellpreisen.
Vergleichstabelle Foto-zu-Video-KI
Die Modellzeilen zeigen den Listenpreis des Anbieters, geprüft am 29. September 2026 (die Preise für Kling 3.0 und Veo 3.1 Fast wurden zuletzt am 21. Mai 2026 geprüft). Die App-Zeilen zeigen den günstigsten bezahlten Tarif auf der Preisseite des Anbieters, geprüft im September 2026.
| Option | Hersteller | Clip-Länge (Foto-zu-Video) | Auflösung | Audio | End-Frame | Preis |
|---|---|---|---|---|---|---|
| Seedance 2.5 | ByteDance | 4 bis 30 s | 480p, 720p, 1080p, 4K | Nativ, standardmäßig an | Ja | $0,18 / $0,36 / $0,90 / $1,80 pro s |
| Seedance 2.5 Turbo | ByteDance | 4 bis 30 s | 720p, 1080p | Nativ, standardmäßig an | Ja | $0,20 / $0,22 pro s |
| Kling 3.0 Standard und Pro | Kuaishou | 3, 5, 10 oder 15 s | Stufen Standard und Pro | Optional Ton, kostet das 1,5-Fache | Ja | Std $0,084 pro s ohne Ton, Pro $0,112 pro s ohne Ton |
| Wan 3.0 | Alibaba | 2 bis 30 s | 480p, 720p, 1080p | Nativ, standardmäßig an | Ja | $0,05 / $0,10 / $0,20 pro s |
| Wan 3.0 Prime | Alibaba | 2 bis 30 s | 480p, 720p, 1080p | Nativ | Ja | $0,075 / $0,15 / $0,30 pro s |
| Wan 2.6 Flash | Alibaba | 2 bis 15 s | 720p, 1080p | Optional, verdoppelt den Preis | Nein | $0,025 pro s bei 720p ohne Ton |
| Veo 3.1 Fast | 4, 6 oder 8 s | 720p, 1080p | Optional | Ja | $0,10 pro s ohne Ton, $0,15 mit Audio | |
| Gemini Omni 1.1 Flash | 3 bis 10 s | 360p, 720p, 1080p, 4K | Immer an | Ja | $0,03 / $0,10 / $0,15 / $0,30 pro s | |
| Runway | Runway | Je nach Modell | Je nach Modell | Je nach Modell | Je nach Modell | Kostenlos: 125 einmalige Credits. Standard $15/Monat ($12/Monat jährlich) |
| Luma | Luma AI | Je nach Modell | Je nach Modell | Je nach Modell | Je nach Modell | Kein kostenloser Tarif aufgeführt. Plus $30/Monat ($25/Monat jährlich) |
| Pika | Pika | Je nach Modell | Je nach Modell | Je nach Modell | Je nach Modell | Kostenlos nur mit Credit-Paketen. Starter $10/Monat |
| Hailuo | MiniMax | Auf der Startseite nicht angegeben | Auf der Startseite nicht angegeben | Nicht angegeben | Nicht angegeben | Tarife waren bei der Prüfung auf der Seite des Anbieters nicht lesbar |
Drei Muster fallen auf. Erstens ist die Preisspanne riesig: Ein 5-Sekunden-Clip in 720p kostet mit Wan 2.6 Flash 0,125 Dollar und mit Seedance 2.5 1,80 Dollar, ein 14-facher Unterschied bei gleicher Länge. Zweitens schaffen nur Seedance 2.5 und Wan 3.0 30 Sekunden in einem Foto-zu-Video-Durchlauf. Drittens verkaufen die Consumer-Apps zunehmend die Modelle anderer Unternehmen: Die Preisseiten von Luma und Pika führen beide Seedance 2.5 auf, die von Runway Seedance 2.0 und Kling 3.0 neben dem eigenen Gen-4.5. Wer sich für eine App entscheidet, wählt oft ebenso sehr einen Abrechnungs-Wrapper und eine Oberfläche wie ein Modell.
1. Seedance 2.5 (ByteDance): die beste Gesamtleistung
Seedance 2.5 ist das Modell, zu dem wir zuerst greifen würden, wenn es auf die Aufnahme ankommt. Im Foto-zu-Video-Modus nimmt es einen Start-Frame und optional einen End-Frame, erzeugt 4 bis 30 Sekunden in einem Durchlauf und gibt 480p, 720p, 1080p oder 4K aus. Natives Audio ist standardmäßig aktiviert. Das Seitenverhältnis folgt deinem Startbild.
Besser als alles andere auf dieser Liste hält es eine Komposition über einen langen Clip hinweg. Geht in einer 20-Sekunden-Aufnahme eine Person durch eine belebte Straße auf die Kamera zu, bleiben Gesicht, Jacke und Hintergrund bis zum letzten Frame deutlich wahrscheinlicher erhalten als bei den Budget-Modellen, und genau daran scheitern lange Foto-zu-Video-Clips normalerweise. Auch mehrstufige Aktionen, die in einem Prompt beschrieben sind („sie nimmt die Tasse, trinkt einen Schluck, stellt sie ab und schaut aus dem Fenster“), setzt es um, ohne die Schritte zusammenzuquetschen.
Preis. Der Listenpreis des Anbieters beträgt 0,18 Dollar pro Sekunde bei 480p, 0,36 Dollar bei 720p, 0,90 Dollar bei 1080p und 1,80 Dollar bei 4K. Ein 5-Sekunden-Clip in 720p kostet 1,80 Dollar, ein 10-Sekunden-Clip in 1080p 9,00 Dollar. Seedance 2.5 wird nur nach Ausgabe abgerechnet, Audio erhöht den Preis also nicht.
Referenzbilder. Seedance 2.5 akzeptiert bis zu 30 Referenzbilder, auf die im Prompt als @Image 1, @Image 2 usw. verwiesen wird. Auf MakeInfluencer.ai gehören diese Referenzen zum Text-zu-Video-Pfad; sobald du einen Start-Frame hochlädst, verankern Start-Frame (und optionaler End-Frame) die Identität. Wenn ein Character in einer neuen Szene erscheinen soll, für die du kein Standbild hast, erzeuge die Szene zuerst mit Referenzen oder erstelle das Standbild mit GPT Image 2.5 und animiere es dann.
Wo es schwächelt. Bei den Kosten. In 1080p ist es hier die teuerste Option pro Sekunde, und wer einen Prompt zum vollen Preis verfeinert, verbrennt schnell Budget. Mehrere Anbieter beschreiben die Stufen 1080p und 4K außerdem als hochskaliert aus einer niedrigeren nativen Auflösung; betrachte 720p daher als natürliche Arbeitsauflösung für Social Media.
Am besten für. Hero-Aufnahmen, lange Einzeltakes, charaktergetriebene Szenen und alles, was im Vollbild läuft. Der Seedance-2.5-API-Leitfaden behandelt alle fünf Seedance-2.5-Modi, einschließlich Video Extend und Talking Avatar.
Ein Seedance-2.5-Turbo-Clip von Foto zu Video, animiert aus einem Storyboard-Frame, der mit GPT Image 2.5 erstellt wurde.
2. Seedance 2.5 Turbo (ByteDance): bester Gegenwert für Seedance-Qualität
Seedance 2.5 Turbo nutzt dieselbe Foto-zu-Video-Schnittstelle wie das Standardmodell: Start-Frame, optionaler End-Frame, 4 bis 30 Sekunden, natives Audio standardmäßig aktiviert. Die Unterschiede sind die Auflösung (nur 720p oder 1080p) und der Preis: 0,20 Dollar pro Sekunde bei 720p und 0,22 Dollar bei 1080p. In 1080p ist das etwa ein Viertel des Preises der Standardstufe.
In der Praxis ist Turbo die Art, wie die meisten Seedance nutzen sollten. Entwirf jede Idee mit Turbo in 720p und 5 Sekunden, das kostet 1,00 Dollar pro Versuch. Wenn Bewegung, Tempo und Identitätstreue stimmen, behältst du entweder den Turbo-Render (er reicht für Social Media oft aus) oder lässt den erfolgreichen Prompt in der endgültigen Länge noch einmal mit Standard-Seedance-2.5 laufen.
Der Workflow vom Entwurf zum Endergebnis
Beim Verfeinern geht das Foto-zu-Video-Budget drauf. Braucht eine Aufnahme sechs Versuche, kosten sechs Turbo-Entwürfe in 720p und 5 Sekunden 6,00 Dollar. Sechs Versuche mit Standard-Seedance-2.5 in 1080p und 10 Sekunden würden 54,00 Dollar kosten. Günstig entwerfen, teuer rendern.
Am besten für. Anzeigen im UGC-Stil, Social-Clips und jedes Projekt mit hohem Volumen. Für einen täglichen Veröffentlichungsplan würden wir dieses Modell wählen.
3. Kling 3.0 (Kuaishou): am besten für kurze, gezielt geführte Character-Aufnahmen
Kling 3.0 gibt es in zwei Stufen, Standard und Pro, und auf MakeInfluencer.ai erzeugt es 3, 5, 10 oder 15 Sekunden aus einem Start-Frame mit optionalem End-Frame in 16:9, 9:16 oder 1:1. Bei Foto-zu-Video akzeptiert es auch einen negativen Prompt, der nützlich ist, um bestimmte Artefakte zu unterdrücken („zusätzliche Finger, Kamerawackeln, Text“). Ton ist optional und wird als Aufschlag berechnet.
Klings Stärke ist gezielte, physische Bewegung bei Menschen: eine Kopfdrehung, ein Haarwurf, eine erhobene Hand zum Winken, ein Schritt nach vorn. Dieselbe Modellfamilie steckt hinter dem eigenen Tool Motion Control, das Bewegung aus einem Referenzvideo auf dein Standbild überträgt. Es ist das richtige Werkzeug, wenn du einen bestimmten Tanz oder eine bestimmte Geste brauchst, statt sie zu beschreiben.
Preis. Standard kostet 0,084 Dollar pro Sekunde ohne Ton und 0,126 Dollar mit Ton, Pro kostet 0,112 Dollar ohne Ton und 0,168 Dollar mit Ton (geprüft am 21. Mai 2026). Ein 5-Sekunden-Clip in Standard kostet ohne Ton 0,42 Dollar. Damit ist Kling 3.0 Standard nach der Entwurfsstufe von Gemini Omni und Wan 3.0 in 480p die günstigste Option hier mit End-Frame-Kontrolle.
Wo es schwächelt. Fünfzehn Sekunden sind die Obergrenze, und die Tonspur ist ein Aufpreis statt fester Bestandteil des Renders. Kling neigt dazu, ausdrucksstarke Bewegung hinzuzufügen, die du nicht verlangt hast, besonders bei längeren Clips. Formuliere Zurückhaltung deshalb ausdrücklich.
Am besten für. Character-Animation, Mode- und Beauty-Clips und kurze Social-Loops. Der Kling-3.0-Video-Leitfaden geht tiefer auf Shot-Typen und Prompts ein.
4. Wan 3.0 (Alibaba): bestes Preis-Leistungs-Verhältnis pro Sekunde mit Audio
Wan 3.0 ist der stille Preis-Leistungs-Sieger dieser Liste. Es erzeugt 2 bis 30 Sekunden aus einem Start-Frame mit optionalem End-Frame in 480p, 720p oder 1080p, mit nativem Audio, standardmäßig aktiviert. Das Seitenverhältnis lässt sich auf 16:9, 9:16, 1:1, 4:3 oder 3:4 einstellen oder folgt dem Eingabebild.
Preis. 0,05 Dollar pro Sekunde bei 480p, 0,10 Dollar bei 720p und 0,20 Dollar bei 1080p, Audio inklusive. Ein 10-Sekunden-Clip in 720p mit Ton kostet 1,00 Dollar. Derselbe Clip kostet mit Standard-Seedance-2.5 3,60 Dollar. Wan 3.0 Prime ist dasselbe Modell mit schnellerer Warteschlange (etwa halb so lange Wartezeit) für 0,075, 0,15 und 0,30 Dollar pro Sekunde.
Wo es schwächelt. Bei schwierigen Aufnahmen wie schnellen Aktionen, belebten Szenen und Nahaufnahmen von Händen weicht es leichter vom Start-Frame ab als Seedance 2.5. Bei ruhigen, gut komponierten Aufnahmen ist der Unterschied klein, bei komplexer Choreografie ist er sichtbar.
Am besten für. Lange Clips mit kleinerem Budget, B-Roll, Produktdrehungen, Hintergründe für Talking Heads und jeden Workflow, in dem du viele Clips von 10 bis 30 Sekunden brauchst. Aus diesem Grund ist es das Standard-Videomodell im MakeInfluencer.ai-Studio. Der Wan-AI-Video-Leitfaden behandelt Prompt-Muster für die Wan-Familie.
5. Wan 2.6 Flash (Alibaba): günstigstes Foto-zu-Video
Wan 2.6 Flash ist eine reine Foto-zu-Video-Stufe. Es erzeugt 2 bis 15 Sekunden in 720p oder 1080p, mit optional generiertem Audio und optionaler Audioeingabe, um das Ergebnis zu steuern. Eine End-Frame-Kontrolle gibt es nicht.
Preis. 0,025 Dollar pro Sekunde bei 720p ohne Ton und 0,05 Dollar mit Audio, 0,0375 und 0,075 Dollar bei 1080p. Ein 5-Sekunden-Clip in 720p ohne Ton kostet 0,125 Dollar, etwa ein Vierzehntel desselben Clips mit Standard-Seedance-2.5.
Wo es schwächelt. Es ist ein Flash-Modell und sieht bei schwierigen Prompts auch so aus: Die Bewegung ist einfacher, feine Details verblassen, und lange Clips verlieren schneller den Zusammenhalt. Hervorragend eignet es sich, um zu testen, ob sich ein Standbild überhaupt animieren lässt, und für Umgebungsbewegung (Haare im Wind, Dampf aus einer Tasse, langsames Push-in), schwächer ist es bei komplexen Aktionen.
Am besten für. Bewegungsideen günstig testen, große Mengen an Umgebungs-Clips und kurze Entwürfe, bevor du dich für einen längeren Render mit einem Premium-Modell entscheidest.
Beste kostenlose Foto-zu-Video-KI
„Kostenlos“ kann in dieser Kategorie drei verschiedene Dinge bedeuten, und es lohnt sich, sie auseinanderzuhalten.
Kostenlos ohne Konto. Auf MakeInfluencer.ai bieten wir keine kostenlose Videogenerierung an; jeder Clip im Studio läuft über Credits, und die Kosten werden vor dem Rendern angezeigt. Ohne Konto bieten wir eine kostenlose Bildvorschau im KI-Bildgenerator an, der unser eigenes offenes Bildmodell mit einem kleinen Tageslimit pro Besucher nutzt. Damit kannst du das Standbild entwerfen, das du animieren willst, aber es erzeugt kein Video und ist keines der hier verglichenen Spitzenmodelle. Von den geprüften Apps bot keine wiederkehrende Foto-zu-Video-Generierung ganz ohne Konto an.
Kostenloses Startguthaben in einer bezahlten App. Der kostenlose Tarif von Runway enthält 125 einmalige Credits und eine Auswahl an Modellen (September 2026 geprüft). Pika führt einen 0-Dollar-Tarif ohne monatliche Credits auf, bei dem du Credit-Pakete nach Bedarf kaufst und die Ausgaben kein Wasserzeichen tragen (September 2026 geprüft). Klings eigene App wirbt mit täglichen kostenlosen Credits für angemeldete Nutzer; laut Seite tragen kostenlose Ausgaben ein Wasserzeichen, das genaue Tageskontingent stand auf der geprüften Seite jedoch nicht, bestätige es also in der App.
Kostenlos innerhalb eines größeren Abos. Google bietet Veo über die Gemini-App und Flow mit kostenlosem Zugang und Testzugang an, der je nach Land und Kontotyp variiert. Ein festes kostenloses Veo-3.1-Kontingent konnten wir auf keiner Google-Seite bestätigen; behandle jede konkrete Zahl, die du anderswo liest, daher als vorläufig.
Für die meisten ist der günstigste ehrliche Weg zur Antwort, ob Foto-zu-Video für dein Bild funktioniert, ein kurzer bezahlter Entwurf: Ein 4-Sekunden-Clip in 720p ohne Ton kostet mit Wan 2.6 Flash zum Listenpreis 0,10 Dollar und zeigt dir, ob das Gesicht hält und ob dein Motion-Prompt verständlich ist. Brauchst du danach Audio, längere Clips oder 1080p, wechsle zu Wan 3.0 oder Seedance 2.5 Turbo.
Was ein Test-Clip tatsächlich kostet
Zwei 4-Sekunden-Entwürfe in 720p kosten zum Listenpreis von Wan 2.6 Flash 0,20 Dollar. Sieh das als Testbudget und nicht als Produktionsbudget: Prüfe Standbild und Motion-Prompt mit günstigen Entwürfen, bevor du für Länge und Auflösung zahlst.
6. Veo 3.1 Fast (Google): beste saubere 8-Sekunden-Clips mit Ton
Veo 3.1 Fast erzeugt 4, 6 oder 8 Sekunden in 720p oder 1080p, in 16:9 oder 9:16, aus einem Start-Frame mit optionalem End-Frame. Audio ist optional. Veos Ruf gründet auf der Ausarbeitung: sauberes Licht, überzeugende Kamerabewegungen und gut synchronisierte Umgebungsgeräusche und Dialoge. Der Veo-3-Prompting-Leitfaden behandelt die Formatierung von Dialogen.
Preis. 0,10 Dollar pro Sekunde ohne Ton und 0,15 Dollar pro Sekunde mit Audio, bei einer einzigen Auflösung (geprüft am 21. Mai 2026). Ein 8-Sekunden-Clip in 1080p mit Audio kostet 1,20 Dollar.
Wo es schwächelt. Acht Sekunden sind die Obergrenze, einen 30-Sekunden-Einzeltake gibt es nicht. Ein quadratisches Format fehlt ebenfalls. Außerdem interpretiert Veo einen Start-Frame tendenziell freier um als Seedance, was für einen filmischen Look großartig ist und weniger großartig, wenn das Produktetikett oder das Gesicht des Characters pixelgenau bleiben muss.
Am besten für. Kurze filmische Beats, Dialogzeilen und Ad-Hooks, bei denen der Ton zählt und 8 Sekunden genügen.
7. Gemini Omni 1.1 Flash (Google): beste Entwurfsstufe
Gemini Omni 1.1 Flash erzeugt 3 bis 10 Sekunden in 360p, 720p, 1080p oder 4K, in 16:9 oder 9:16, mit immer aktivem synchronisiertem Audio und optionalem End-Frame für die Interpolation.
Preis. 0,03 Dollar pro Sekunde bei 360p, 0,10 Dollar bei 720p, 0,15 Dollar bei 1080p und 0,30 Dollar bei 4K. Ein 5-Sekunden-Entwurf in 360p kostet 0,15 Dollar. Damit ist es der günstigste Weg, eine Aufnahme mit Audio vorab anzusehen.
Wo es schwächelt. Zehn Sekunden sind das Maximum, das Audio lässt sich nicht abschalten (bei stummem B-Roll kannst du also nichts sparen), und 360p taugt nur zur Beurteilung der Bewegung, nicht zum Veröffentlichen.
Am besten für. Schnelle Vorschau von Bewegung und Timing, bevor du dich auf einen teureren Render festlegst, und für kurze 4K-Clips, bei denen Seedance 2.5 in 4K pro Sekunde sechsmal so viel kostet.
8. Runway: bester Editor rund um ein eigenes Modell
Runway verkauft eine Creative Suite statt eines einzelnen Modells. Auf der Preisseite (September 2026 geprüft) stehen Gen-4.5 und Aleph 2.0 als eigene Videomodelle, außerdem Seedance 2.0 Pro, Seedance 2.0 Fast und Kling 3.0. Die Tarife: Free mit 125 einmaligen Credits und 5 GB Speicher, Standard für 15 Dollar pro Monat (12 Dollar pro Monat bei jährlicher Abrechnung) mit 625 Credits, Pro für 35 Dollar pro Monat (28 Dollar jährlich) mit 2.250 Credits und Max für 95 Dollar pro Monat (76 Dollar jährlich) mit 9.500 Credits.
Stärken. Ein ausgereifter Editor, Video-zu-Video-Werkzeuge und ein durchgängiger Workflow für Teams, die ohnehin in Runway schneiden. Wenn du ein Standbild animieren und dann bearbeiten, verlängern und zusammensetzen willst, ohne die App zu verlassen, ist Runway hier das vollständigste Paket.
Wo es schwächelt. Die Umrechnung von Credits in Sekunden hängt von Modell und Einstellungen ab, die Kosten pro Clip lassen sich daher schwerer vorhersagen als bei Modellpreisen pro Sekunde. Auf der Preisseite stand bei der Prüfung Seedance 2.0 statt 2.5.
Am besten für. Cutter und kleine Studios, die Generierung und Postproduktion an einem Ort wollen.
9. Luma und Pika: Abos mit mehreren Modellen
Luma (September 2026 geprüft) hat auf der Preisseite keinen kostenlosen Tarif. Plus kostet 30 Dollar pro Monat (25 Dollar jährlich) mit 10.000 Credits, Pro 90 Dollar pro Monat (75 Dollar jährlich) mit 40.000 Credits und Ultra 300 Dollar pro Monat (250 Dollar jährlich) mit 150.000 Credits. Neben den eigenen Ray3-Modellen führt die Seite Seedance 2.0 und 2.5, Kling 3.0, Veo 3.1, MiniMax H3 und Gemini Omni Flash auf. Lumas eigene Modelle gelten seit Langem als stark bei atmosphärischer, filmischer Bewegung.
Pika (September 2026 geprüft) führt einen kostenlosen Tarif ohne monatliche Credits auf (nur Credit-Pakete), Starter für 10 Dollar pro Monat mit 900 Credits, Creator für 35 Dollar pro Monat mit 3.150 Credits und kommerzieller Lizenz sowie einen Fancy-Tarif ab 95 Dollar pro Monat. Credit-Pakete werden zu 60 Credits pro Dollar verkauft. Die Seite nennt Seedance 2.5 und Wan 3.0 unter den verfügbaren Modellen und gibt an, dass Ausgaben in jedem Tarif ohne Wasserzeichen sind.
Wo sie schwächeln. Beide sind Abo-Wrapper um eine Mischung aus Modellen. Das ist praktisch, aber du zahlst für einen Tarif, egal ob du ihn nutzt, und bist einen Schritt von der Abrechnung pro Sekunde entfernt. Prüfe, ob das Modell und die Auflösung, die du brauchst, in der gewählten Stufe enthalten sind; die Preisseiten nennen keine Auflösungsgrenzen pro Modell.
Am besten für. Creator, die eine monatliche Rechnung und eine Oberfläche für mehrere Modellfamilien wollen.
10. Hailuo (MiniMax): testenswert für ausdrucksstarke Bewegung
Hailuo ist die Consumer-Video-App von MiniMax. Als wir die Startseite im September 2026 geprüft haben, führte sie mit MiniMax H3 und zeigte Foto-zu-Video-Vorlagen wie Tanz- und Musikvideo-Effekte. Die Seite mit den Abos lieferte uns keine lesbaren Tarifdetails, und Preiszusammenfassungen von Drittanbietern widersprechen sich, daher geben wir hier keine Preise an. Prüfe die Tarifseite direkt, bevor du budgetierst.
Am besten für. Vorlagengetriebene Foto-Animation und energiegeladene menschliche Bewegung. Auch Lumas Preisseite führt MiniMax H3, das ist ein weiterer Weg, es auszuprobieren.
Weitere Apps, die wir nicht bewertet haben
Higgsfield ist eine große Plattform mit mehreren Modellen, die Seedance 2.5, Kling 3.0 und Wan 3.0 neben dem eigenen Foto-zu-Video-Modell DoP verkauft und im September 2026 eine öffentliche API gestartet hat. Die Tarifpreise unterscheiden sich je nach Quelle, und wir konnten sie am Prüftag nicht von der Preisseite ablesen; es wird daher separat in unserem Higgsfield-Alternative-Leitfaden behandelt. Auch Adobe, Canva und CapCut haben Foto-zu-Video-Funktionen in ihren breiteren Bearbeitungs-Suiten. Sie sind sinnvoll, wenn du dafür ohnehin zahlst, aber keine von ihnen veröffentlicht Limits pro Clip klar genug für einen Vergleich hier.
Motion-Prompts schreiben, die bei Foto-zu-Video funktionieren
Der häufigste Fehler bei Foto-zu-Video ist, einen Text-zu-Video-Prompt zu schreiben. Das Modell sieht die Szene bereits. Wenn du die Frau, das rote Kleid, das Café und die goldene Stunde noch einmal beschreibst, lädst du es ein, sie neu zu zeichnen, und aus dem Neuzeichnen entsteht Identitätsdrift. Ein Foto-zu-Video-Prompt sollte in dieser Reihenfolge beschreiben, was sich ändert, wie sich die Kamera bewegt und was gleich bleiben muss.

Ein guter Motion-Prompt beschreibt Veränderung, Kamera und Einschränkungen, nicht die Szene, die das Modell ohnehin sieht.
Bewegung des Motivs
Eine oder zwei konkrete Aktionen mit einer Geschwindigkeit. ‚Sie dreht den Kopf langsam zur Kamera und lächelt leicht‘ ist besser als ‚sie bewegt sich natürlich‘.
Sekundäre Bewegung
Was sich um das Motiv herum bewegt: Haare in einer leichten Brise, aufsteigender Dampf aus der Tasse, Blätter im Hintergrund, unscharf vorbeiziehender Verkehr.
Kamera
Eine einzige Kameraanweisung: statisch, langsames Push-in, langsames Pull-back, Handkamera mit leichtem Schwanken, Orbit nach links, Neigen nach oben. Zwei Bewegungen gleichzeitig führen meist zu schwebender Bewegung.
Einschränkungen
Was sich nicht ändern darf: Gesicht, Outfit und Bildausschnitt unverändert lassen, das Etikett lesbar halten, keine neuen Personen im Bild.
Hier sind Motion-Prompts, die wir verwenden, nach Aufgabe gruppiert. Sie sind für einen Start-Frame geschrieben, der das Motiv bereits enthält, und beschreiben es deshalb nicht noch einmal.
Porträt oder Creator, der in die Kamera spricht (UGC-Hook)
Gefühl einer Handykamera aus der Hand mit leichtem natürlichem Wackeln. Sie schaut in die Linse, hebt leicht die Augenbrauen und beginnt zu sprechen, dabei gestikuliert sie einmal mit der rechten Hand. Die Haare bewegen sich leicht. Gesicht, Outfit und Hintergrund bleiben unverändert. Kein Zoom.
Produkt auf einem Tisch (E-Commerce)
Statische Kamera. Die Flasche dreht sich langsam im Uhrzeigersinn auf der Marmoroberfläche, etwa eine Vierteldrehung über den gesamten Clip. Weiches Licht gleitet beim Drehen über das Glas. Das Etikett bleibt scharf und lesbar, der Hintergrund unverändert. Keine Hände im Bild.
Lifestyle-Aufnahme mit Leben in der Umgebung
Langsames Push-in auf das Motiv. Dampf steigt aus der Kaffeetasse, der Vorhang hinter ihr bewegt sich sanft im Wind, und sie hebt die Tasse und nimmt einen Schluck. Alles andere bleibt ruhig. Identität und Bildausschnitt bleiben unverändert.
Mode-Walk
Die Kamera fährt rückwärts in Gehgeschwindigkeit, während sie auf dem Gehweg auf die Kamera zugeht, die Arme schwingen natürlich, der Saum des Mantels schwingt bei jedem Schritt mit. Fußgänger im Hintergrund bewegen sich unscharf. Gesicht und Outfit bleiben identisch zum ersten Frame.
Musikvideo-Beat
Langsamer Orbit nach links um die Sängerin. Bühnenlichter pulsieren und wandern hinter ihr, Dunst zieht durch die Lichtstrahlen, und sie neigt den Kopf im Takt zurück. Gesicht und Kostüm bleiben unverändert. Kein Text und keine neuen Personen.
Character-Animation, ruhige Idle-Schleife
Statische Kamera. Der Character atmet langsam, blinzelt einmal und verlagert sein Gewicht leicht von einem Fuß auf den anderen. Haare und Stoff bewegen sich sanft. Das Ende entspricht derselben Pose wie der erste Frame. Stil und Proportionen bleiben unverändert.
Gib für die Idle-Schleife bei jedem Modell, das es unterstützt (Seedance 2.5, Kling 3.0, Wan 3.0, Veo 3.1 Fast, Gemini Omni 1.1 Flash), das Startbild noch einmal als End-Frame an. Das schließt die Schleife sauber und ist viel zuverlässiger, als in Worten um eine nahtlose Schleife zu bitten.
Tempo-Wörter zählen mehr als Adjektive
„Langsam“, „etwa eine Vierteldrehung“, „einmal“ und „in Gehgeschwindigkeit“ leisten mehr als „filmisch“, „atemberaubend“ oder „schön“. Foto-zu-Video-Modelle übertreiben standardmäßig; die Mengenangaben halten die Bewegung im Verhältnis zur Clip-Länge.
Lass den Start-Frame die Arbeit machen
Der Start-Frame entscheidet mehr über das Ergebnis als der Prompt. Ein paar Regeln, die wir vor dem Animieren jedes Standbilds anwenden:
- Das Seitenverhältnis von Anfang an passend wählen. Schneide auf 9:16 zu, bevor du einen Hochkant-Clip animierst. Wenn das Modell fehlende Bereiche per Outpainting ergänzt, erfindet es Inhalt an den Rändern, und erfundener Inhalt driftet.
- Platz für die Bewegung lassen. Wenn das Motiv eine Hand heben soll, muss die Hand irgendwohin können. Ein eng beschnittenes Porträt, das „winken“ soll, führt zu Beschnitt oder einer Hand aus dem Nichts.
- Hände klar zeigen oder gar nicht. Halb verdeckte Hände sind die häufigste Ursache für Verformungen. Zeige sie entweder vollständig und entspannt oder schneide sie weg.
- Weiches, gerichtetes Licht bevorzugen. Hartes Mittagslicht und gemischte Farbtemperaturen flackern stärker, wenn das Modell ein sich bewegendes Gesicht neu ausleuchtet.
- Text auf ein Minimum beschränken. Etiketten und Beschriftungen überstehen Bewegung am besten, wenn sie groß, frontal zur Kamera und wenig sind.
Für die Standbilder selbst ist GPT Image 2.5 unsere erste Wahl bei fotorealistischen Start-Frames, weil es Anweisungen zum Bildausschnitt genau befolgt. Der Leitfaden zur Character-Konsistenz zeigt, wie du dieselbe Person über mehrere Standbilder hinweg beibehältst, bevor du sie animierst, und der Storyboard-zu-Film-Workflow, wie du eine Folge von Start- und End-Frames für ein Stück mit mehreren Aufnahmen planst.
So wählst du: Foto-zu-Video-KI nach Einsatzzweck
Ranglisten helfen nur begrenzt. Das richtige Modell hängt davon ab, wofür der Clip gedacht ist. Das sind die Entscheidungen, die wir für die vier Aufgaben treffen würden, nach denen am häufigsten gefragt wird.
UGC-Anzeigen
Empfehlung: Seedance 2.5 Turbo in 720p, 9:16, 5 bis 10 Sekunden, Audio an für Entwürfe.
UGC-Anzeigen brauchen eine glaubwürdige Person, einen Hook in den ersten zwei Sekunden und Menge: Du testest viele Varianten desselben Konzepts. Bei Turbo kostet eine Variante von 10 Sekunden mit 0,20 Dollar pro Sekunde in 720p 2,00 Dollar, und es hält ein Gesicht gut genug für die Ansicht in Smartphone-Größe. Hat die Anzeige eine gesprochene Zeile, erzeuge das Bild mit Foto-zu-Video und füge die Stimme mit dem Lippensync-Tool hinzu, damit du das Skript genau kontrollierst. Der Leitfaden zu KI-UGC-Anzeigen behandelt Hooks, Skripte und Kennzeichnung, und der KI-Ad-Generator ist ein Startpunkt ohne Anmeldung für Anzeigen-Standbilder.
Budget-Alternative: Wan 3.0 in 720p, 1,00 Dollar für 10 Sekunden mit Audio.
Produktaufnahmen
Empfehlung: Wan 3.0 oder Seedance 2.5 Turbo mit Start- und End-Frame.
Produkt-Clips stehen und fallen mit dem Etikett. Nimm eine statische oder langsam kreisende Kamera, eine Vierteldrehung und einen End-Frame, der das Produkt aus dem Endwinkel zeigt, damit das Modell interpoliert, statt die Rückseite der Verpackung zu erfinden. Halte Clips bei 4 bis 6 Sekunden; bei längeren Drehungen hat das Modell mehr Gelegenheiten, den Text neu zu zeichnen. Für Hero-Platzierungen auf einer Landingpage lässt du den Gewinner in 1080p noch einmal mit Standard-Seedance-2.5 laufen.
Character-Animation
Empfehlung: Kling 3.0 für kurze, gezielte Aktionen, Seedance 2.5 für lange Takes.
Bei einem konsistenten KI-Character ist die Identitätstreue die ganze Aufgabe. Kling 3.0 ist stark bei einer einzelnen bewussten Aktion in 5 bis 10 Sekunden, und sein negativer Prompt hilft, wiederkehrende Artefakte zu unterdrücken. Bei Takes von 15 bis 30 Sekunden hält Seedance 2.5 das Gesicht zuverlässiger. Brauchst du eine bestimmte choreografierte Bewegung, nutze Motion Control mit einem Referenzvideo, statt sie zu beschreiben. Der Leitfaden zum Erstellen eines KI-Influencers aus einem Foto behandelt den Aufbau des Characters selbst.
Musikvideo
Empfehlung: Seedance 2.5 oder Wan 3.0 für Aufnahmen von 15 bis 30 Sekunden, stumm, anschließend auf deinen Track geschnitten.
Betrachte natives Audio in einer Musikvideo-Aufnahme als verzichtbar: Du ersetzt es ohnehin durch den Song. Schalte Audio aus, wo das Modell es erlaubt, und ignoriere es bei der Beurteilung der Takes. Plane das Stück als Folge von Start-Frames, erzeuge jede Aufnahme in der Länge einer musikalischen Phrase und schneide im Editor auf den Beat. Mit Wan 3.0 zu 0,10 Dollar pro Sekunde in 720p kostet ein Video aus 20 Aufnahmen à 10 Sekunden 20 Dollar an Generierung, noch ohne Wiederholungen. Unsere Seite zum KI-Musikvideo-Generator ist um diesen Workflow herum aufgebaut.
Häufige Fehlerbilder und wie du sie behebst
Jedes Modell auf dieser Liste scheitert auf dieselben wenigen Arten. Wer den Fehler kennt, weiß, an welchem Hebel er ziehen muss.

Markiere den ersten Frame, in dem ein Clip bricht; er zeigt dir, ob du Prompt, Startbild oder Länge ändern musst.
Identitätsdrift
Symptom. Das Gesicht in der letzten Sekunde ist eine etwas andere Person als im ersten Frame. Kieferpartie, Augenform oder Haaransatz verschieben sich allmählich, oft nach einer Kopfbewegung.
Lösungen.
- Entferne Aussehen-Beschreibungen aus dem Prompt. Wer die Person beschreibt, lädt das Modell ein, sie neu zu zeichnen.
- Füge eine ausdrückliche Einschränkung hinzu: „Gesicht identisch zum ersten Frame halten.“
- Kürze den Clip. Drift summiert sich mit der Zeit; zwei zusammengeschnittene Clips von 8 Sekunden sind oft besser als ein Clip von 16 Sekunden.
- Gib einen End-Frame derselben Person an. Sind beide Enden festgelegt, hat das Modell viel weniger Spielraum abzudriften.
- Reduziere die Kopfdrehung. Eine Drehung von mehr als etwa 45 Grad zwingt das Modell, die nicht sichtbare Seite des Gesichts zu erfinden.
- Wechsle auf eine höhere Stufe. Bei schwierigen Aufnahmen hält Seedance 2.5 die Identität besser als die Budget-Modelle.
Verformte Hände und Objekte
Symptom. Finger verschmelzen, vermehren sich oder knicken unmöglich ab, eine Tasse schmilzt in die Hand, Schmuck ändert die Form.
Lösungen.
- Korrigiere zuerst den Start-Frame. Teilweise verdeckte, überlappende oder am Bildrand liegende Hände sind die übliche Ursache.
- Gib den Händen eine einfache Aufgabe: „hebt die Tasse und nimmt einen Schluck“, nicht „gestikuliert beim Sprechen und richtet die Haare“.
- Füge bei Kling 3.0 einen negativen Prompt hinzu: „zusätzliche Finger, verschmolzene Finger, deformierte Hände“.
- Verlangsame die Aktion. Bei schneller Handbewegung beginnen Bewegungsunschärfe und Verformung.
- Schneide die Hände aus dem Start-Frame heraus, wenn sie nicht im Bild sein müssen.
Zu viel Bewegung
Symptom. Alles bewegt sich gleichzeitig: Die Kamera rauscht durchs Bild, das Motiv tanzt, obwohl du nur ein Lächeln wolltest, der Hintergrund wellt sich. Der Clip wirkt wie eine KI-Demo statt wie Filmmaterial.
Lösungen.
- Nutze eine einzige Kameraanweisung oder „statische Kamera“.
- Ergänze Mengenangaben: „langsam“, „einmal“, „leicht“, „eine Vierteldrehung“.
- Sage, was ruhig bleibt: „alles andere bleibt ruhig“.
- Passe die Länge an die Aktion an. Ein einzelnes Lächeln braucht keine 10 Sekunden; das Modell füllt zusätzliche Zeit mit zusätzlicher Bewegung. Nimm 4 bis 5 Sekunden.
- Schalte die Prompt-Erweiterung ab, wo es sie gibt. Auf MakeInfluencer.ai ist sie bei Wan 3.0 standardmäßig aus, dein Prompt wird also nicht in etwas Hektischeres umgeschrieben.
Eingefrorene oder fast statische Ausgabe
Symptom. Das gegenteilige Problem: Der Clip ist ein Standbild mit leichtem Zoom.
Lösungen. Gib ein konkretes Tätigkeitsverb und eine sekundäre Bewegungsquelle an („Dampf steigt auf“, „Haare wehen im Wind“). Vermeide Prompts, die nur aus Einschränkungen bestehen. Friert ein Modell ein bestimmtes Bild immer wieder ein, probiere ein anderes Modell; manche Standbilder (flache Grafiken, sehr enge Ausschnitte) geben dem Modell schlicht nichts zum Bewegen.
Schäden an Etiketten und Text
Symptom. Ein Produktetikett verblasst, Buchstaben vertauschen sich, Logos verschmieren bei der Drehung.
Lösungen. Halte die Drehung klein, halte das Etikett im Start- und End-Frame zur Kamera, nutze Clips von 4 bis 6 Sekunden und rendere das Endergebnis in 1080p. Ist ein Clip sonst perfekt und nur das Etikett wackelt, ist es oft schneller, das Original-Etikett im Schnitt wieder einzusetzen, als neu zu generieren.
Audio, das nicht passt
Symptom. Das native Audio fügt Musik, Publikumslärm oder Sprache hinzu, die du nicht wolltest.
Lösungen. Beschreibe im Prompt den Ton, den du brauchst („ruhiger Raumton, eine einzelne Tasse auf dem Tisch“), oder schalte das Audio bei Modellen ab, die es erlauben (Seedance 2.5, Wan 3.0, Wan 2.6 Flash, Kling 3.0, Veo 3.1 Fast), und ergänze den Ton im Schnitt. Gemini Omni 1.1 Flash erzeugt immer Audio.
Mach einen Nachmittags-Test, bevor du dich festlegst
Ranglisten sind ein Ausgangspunkt. Deine Standbilder, dein Motiv und deine Plattform entscheiden über den Gewinner. Dieser Test dauert etwa zwei Stunden und kostet ein paar Dollar.
- Wähle drei Standbilder, die deine echte Arbeit abbilden: eine Person, ein Produkt, eine weite Szene. Schneide jedes auf dein Veröffentlichungs-Seitenverhältnis zu.
- Schreibe für jedes Standbild einen Motion-Prompt mit der oben gezeigten vierteiligen Struktur.
- Lass jedes Standbild durch drei Modelle laufen, in 720p und 5 Sekunden: ein Budget-Modell (Wan 2.6 Flash oder Wan 3.0), ein Mittelklasse-Modell (Seedance 2.5 Turbo oder Kling 3.0 Standard) und ein Premium-Modell (Seedance 2.5 oder Veo 3.1 Fast). Lass die Budget-Stufe zuerst im Foto-zu-Video-Studio laufen; so vergleichst du Bewegung am günstigsten.
- Bewerte jeden Clip nach drei Kriterien: Identitätstreue (passt der letzte Frame zum ersten?), Bewegungsqualität (Hände, Stoffe, Kamera) und Brauchbarkeit (würdest du ihn veröffentlichen?).
- Teile die Kosten durch die Zahl der brauchbaren Clips. Ein Modell, das doppelt so viel kostet, aber doppelt so oft brauchbar ist, kostet pro veröffentlichtem Clip dasselbe.
- Lass den besten Prompt noch einmal laufen, mit dem Gewinnermodell. Konsistenz über mehrere Läufe zählt mehr als ein glücklicher Render.
Auf MakeInfluencer.ai läuft der ganze Test an einem Ort: Der KI-Video-Generator zeigt jedes Modell aus diesem Leitfaden, blendet die Credit-Kosten vor jedem Render ein und speichert deine Prompts im Verlauf. Entwickler können denselben Vergleich über die API durchführen, wo jedes Modell ein POST-Request ist; der Foto-zu-Video-API-Leitfaden führt dich durch.
Häufig gestellte Fragen
Was ist die beste Foto-zu-Video-KI 2026?
Für Gesamtqualität und Kontrolle ByteDance Seedance 2.5: 4 bis 30 Sekunden, bis zu 4K, natives Audio sowie Start- und End-Frames. Für die tägliche Arbeit liefert Seedance 2.5 Turbo ähnliche Ergebnisse in 720p oder 1080p für 0,20 bis 0,22 Dollar pro Sekunde. Für das beste Preis-Leistungs-Verhältnis pro Sekunde mit Audio empfehlen wir Alibaba Wan 3.0 mit 0,10 Dollar pro Sekunde in 720p.
Was ist die beste kostenlose Foto-zu-Video-KI?
MakeInfluencer.ai bietet keine kostenlose Videogenerierung an; das Studio läuft über Credits, und der günstigste Entwurf ist Alibaba Wan 2.6 Flash mit 0,025 Dollar pro Sekunde in 720p ohne Ton. Den Start-Frame kannst du kostenlos mit unserem KI-Bildgenerator entwerfen, der kein Konto braucht. Bei den Apps bietet Runways kostenloser Tarif 125 einmalige Credits, und Klings App bietet tägliche kostenlose Credits mit Wasserzeichen in der Ausgabe (beides September 2026 geprüft).
Kann ich ein Foto einer echten Person animieren?
Technisch ja, und die meisten Tools tun es. Ob du es solltest, hängt von der Einwilligung und den Regeln der Plattform ab. Animiere nur Fotos von Menschen, die zugestimmt haben, gib synthetisches Filmmaterial einer echten Person nie als echt aus und halte dich an die Kennzeichnungsregeln der Plattform, auf der du veröffentlichst. Unser Studio moderiert Uploads außerdem und lehnt Bilder ab, die es nicht animieren kann.
Welche Foto-zu-Video-KI hält das Gesicht am konsistentesten?
Seedance 2.5 hält die Identität über lange Clips insgesamt am besten, gefolgt von Kling 3.0 bei kurzen, gezielt geführten Aufnahmen. Bei jedem Modell verbessert sich die Identitätstreue am stärksten, wenn du aufhörst, die Person im Prompt zu beschreiben, Clips kurz hältst und einen End-Frame festlegst.
Wie lang kann ein Foto-zu-Video-Clip sein?
Seedance 2.5, Seedance 2.5 Turbo und Wan 3.0 schaffen 30 Sekunden in einer Generierung. Kling 3.0 und Wan 2.6 Flash schaffen 15 Sekunden, Gemini Omni 1.1 Flash 10 Sekunden und Veo 3.1 Fast 8 Sekunden. Mit Seedance 2.5 Video Extend lässt sich ein Clip über eine Generierung hinaus fortsetzen.
Wie viel kostet Foto-zu-Video-KI?
Zu den Listenpreisen der Anbieter kostet ein 5-Sekunden-Clip in 720p zwischen 0,125 Dollar (Wan 2.6 Flash, ohne Ton), 0,42 Dollar (Kling 3.0 Standard, ohne Ton), 0,50 Dollar (Wan 3.0 mit Audio), 1,00 Dollar (Seedance 2.5 Turbo) und 1,80 Dollar (Seedance 2.5). Die vollständige Tabelle steht im Leitfaden zu KI-Video-Modellpreisen.
Ist Sora 2 noch eine Option für Foto-zu-Video?
Nein. OpenAI hat die Sora-Video-API am 24. September 2026 eingestellt. Nutze stattdessen Seedance 2.5, Veo 3.1 Fast oder Wan 3.0.
Was ist der Unterschied zwischen Foto-zu-Video und Text-zu-Video?
Text-zu-Video erfindet die ganze Szene aus Worten. Foto-zu-Video startet mit deinem Bild, du kontrollierst also Motiv, Komposition und Licht genau, und das Modell fügt nur Bewegung hinzu. Deshalb ist Foto-zu-Video der Standard-Workflow für konsistente Characters und Produkte: Den Look in einem Standbild festlegen und ihn dann animieren.
Brauche ich einen End-Frame?
Nein, aber es ist die zuverlässigste Kontrolle, die du hast. Ein End-Frame macht aus der Generierung eine Interpolation zwischen zwei bekannten Bildern, das verringert Drift, verhindert zu viel Bewegung und macht Loops möglich. Seedance 2.5, Kling 3.0, Wan 3.0, Veo 3.1 Fast und Gemini Omni 1.1 Flash akzeptieren alle einen; Wan 2.6 Flash nicht.
Welches Seitenverhältnis sollte ich nutzen?
Nutze das Verhältnis, in dem du veröffentlichst, und schneide den Start-Frame vor dem Animieren darauf zu: 9:16 für TikTok, Reels und Shorts, 16:9 für YouTube und Web, 1:1 für Feeds. Veo 3.1 Fast und Gemini Omni 1.1 Flash bieten nur 16:9 und 9:16.
Fazit
Die beste Foto-zu-Video-KI ist für die meisten 2026 kein einzelnes Modell, sondern eine Gewohnheit in zwei Schritten: günstig testen, dann einmal mit dem Modell rendern, das zur Aufnahme passt. Entwirf das Standbild mit dem kostenlosen KI-Bildgenerator, prüfe mit einem günstigen Wan-2.6-Flash-Clip im Foto-zu-Video-Studio, ob es sich animieren lässt, entwirf mit Seedance 2.5 Turbo oder Wan 3.0 und spare dir Standard-Seedance-2.5 oder Veo 3.1 Fast für die Clips auf, die das Stück tragen. Aktuelle Tarife stehen auf der Preisseite, und den Preis pro Sekunde jedes Modells findest du im Preisleitfaden. Fragen zu einem bestimmten Workflow kannst du an [email protected] schicken.
Modellfähigkeiten und Listenpreise der Anbieter wurden am 29. September 2026 aus der Modell-Registry und dem Preis-Manifest von MakeInfluencer.ai übernommen (die Preise für Kling 3.0 und Veo 3.1 Fast zuletzt am 21. Mai 2026 geprüft). Die Tarife von Runway, Luma und Pika stammen von der öffentlichen Preisseite des jeweiligen Anbieters und sind mit „September 2026 geprüft“ gekennzeichnet. Zahlen zu Kling-App, Hailuo und Google, die sich auf der Seite des Herstellers nicht bestätigen ließen, sind als unbestätigt angegeben. Dieser Leitfaden steht in keiner Verbindung zu ByteDance, Kuaishou, Alibaba, Google, Runway, Luma AI, Pika oder MiniMax.