Eine Idee → ein Kurzfilm
Film erstellen

KI-Storyboard-Generator: Workflow mit GPT Image 2.5 und Seedance 2.5

Aus einer Beschreibung einen Kurzfilm mit vier Shots machen: Shot-Liste, Character-Konsistenz, Kamerasprache, Prompts pro Shot und Kostenrechnung.

Anleitung33 Min. Lesezeit

Erstelle deinen KI-Influencer

Schließe dich 300.000+ Creators an, die mit KI-generierten Inhalten verdienen. Keine technischen Kenntnisse nötig.

Jetzt erstellen

Veröffentlicht am 29. September 2026. Die Modellpreise sind Listenpreise der Anbieter von diesem Datum, entnommen aus derselben Preistabelle, die den Credit-Rechner von MakeInfluencer.ai antreibt. Die Plattform zeigt vor jedem Lauf die genauen Credit-Kosten an.

Die meisten KI-Videos scheitern an derselben Stelle. Du schreibst einen langen Prompt, wartest auf das Rendern und bekommst einen Clip, in dem sich das Gesicht verändert hat, der Bildausschnitt nicht stimmt und das Licht mittendrin gewechselt hat. Dann startest du einen neuen Versuch, und jeder neue Versuch kostet Video-Credits, also die teuerste Art, Fehler zu beheben.

Filmemacher haben dieses Problem lange vor generativen Modellen gelöst. Sie zeichnen ein Storyboard: ein Standbild pro Einstellung, abgestimmt, bevor jemand die Kamera lädt. Dieselbe Disziplin funktioniert bei KI-Video, und sie funktioniert heute besser denn je, weil zwei Modelle für je eine Hälfte der Aufgabe außergewöhnlich gut sind. OpenAI GPT Image 2.5 zeichnet präzise, character-konsistente Frames für ein paar Cent pro Bild. ByteDance Seedance 2.5 animiert einen fertigen Frame zu einem Clip mit natürlichem, synchronisiertem Ton und behält bei, was der Frame festgelegt hat.

Dieser Leitfaden ist die ausführliche Version. Er zeigt, wie du eine Shot-Liste schreibst, der ein Modell folgen kann, wie du einen Character über mehrere Frames stabil hältst, welche Kamerasprache die Ausgabe tatsächlich verändert, Prompt-Muster für jeden Shot-Typ, ein vollständiges Beispiel von der Beschreibung bis zu vier fertigen Clips mit jedem gezeigten Prompt, eine Kostenrechnung Zeile für Zeile, einen günstigen Entwurfs-Workflow und einen ehrlichen Vergleich mit anderen KI-Storyboard-Generatoren. Der letzte Teil zeigt die Version mit einem Klick: die Vorlage Storyboard to Film im AI Canvas.

Der Schreibtisch eines Filmregisseurs mit einer Reihe gedruckter filmischer Storyboard-Frames, einem Kameraobjektiv und einem Laptop mit Video-Timeline
4
Shots pro Lauf ca. $4,16 Listenpreis pro Lauf 1 Beschreibung zu schreiben 20s Fertige Sequenz

Was ein KI-Storyboard-Generator wirklich tut

Ein KI-Storyboard-Generator verwandelt ein Skript oder eine kurze Beschreibung in eine Folge von Standbildern, eines pro Einstellung, damit du ein Video ansehen und freigeben kannst, bevor du es produzierst. Ältere Tools hörten dort auf: Sie zeichneten Skizzen oder Stock-Illustrationen für ein Kundengespräch. Die neue Generation von Storyboard-zu-Video-Tools ergänzt den Produktionsschritt. Jeder freigegebene Frame wird zum Start-Frame eines Videoclips, das Board ist also kein Plan für den Film, sondern die erste Hälfte des Films.

Diese Änderung ist wichtig, weil Bild- und Videomodelle auf unterschiedliche Weise scheitern. Bildmodelle sind gut bei Komposition, Garderobe, Gesichtern und Licht, und sie kosten wenig, wenn man sie neu laufen lässt. Videomodelle sind gut bei Bewegung und Ton, aber wenn du ihnen aufträgst, auch die Komposition zu erfinden, verbrauchen sie ihre Kapazität mit Raten, und kleine Ratefehler summieren sich über fünf oder zehn Sekunden. Ein Storyboard teilt das Problem: Das Bildmodell entscheidet, wie die Einstellung aussieht, und das Videomodell nur, wie sie sich bewegt.

Warum zuerst das Storyboard

Ein KI-Storyboard ist ein Produktionsbriefing, kein Moodboard. Jeder Frame beantwortet zwei Fragen: Was muss fest bleiben (Character, Garderobe, Set, Licht) und was bewegt sich (eine Aktion, eine Kamerabewegung). Ist der Frame freigegeben, muss das Videomodell kaum noch etwas erfinden.

Daraus ergeben sich drei praktische Effekte:

  1. Du legst den Look fest, bevor du Video-Credits ausgibst. Ein Frame mit GPT Image 2.5 Flare und Character-Referenz kostet in 1K und mittlerer Qualität zum Listenpreis $0,039. Ein Clip von fünf Sekunden mit Seedance 2.5 Turbo in 720p kostet $1,00. Der Frame ist rund 25-mal günstiger, iteriere also dort.
  2. Dieselbe Referenz speist jede Einstellung. Dein Character-Referenzbild geht in jeden Frame, das Gesicht bleibt also über die Sequenz erhalten, statt von Einstellung zu Einstellung zu driften.
  3. Du generierst einen Frame oder einen Clip neu, nicht die ganze Sequenz. Wenn Einstellung drei nicht stimmt, lässt du Einstellung drei noch einmal laufen.

Die zwei Modelle und warum sie gut zusammenpassen

GPT Image 2.5 Flare (Frames)

OpenAIs Bildmodell vom September 2026. Schärfer als GPT Image 2 bei etwa halber Latenz, stark bei Bildausschnitt und dem Befolgen von Anweisungen, und es akzeptiert bis zu 16 Referenzbilder, wodurch der Character konsistent bleibt. Frames brauchten in unseren Tests etwa 27 Sekunden pro Bild.

Seedance 2.5 (Clips)

ByteDances Flaggschiff-Videomodell, veröffentlicht am 31. Juli 2026. Es animiert einen Start-Frame zu einem Clip von 4 bis 30 Sekunden mit synchronisiertem Audio, behält Motiv, Garderobe und Beleuchtung des Frames bei und bietet einen optionalen End-Frame. Turbo-Stufe für Entwürfe, Standardstufe für finale Versionen.

GPT Image 2.5 gibt es auf MakeInfluencer.ai in zwei Varianten. Flare ist das Generierungsmodell, das die Vorlage nutzt. Sunburst ist auf präzise Bearbeitungen abgestimmt, die Gesichter, Produkte und Layouts erhalten, und damit das richtige Werkzeug, wenn du an einem freigegebenen Frame nur eine Sache ändern willst (die Jackenfarbe wechseln, den Character nach links verschieben), ohne den Rest neu zu zeichnen.

Auch Seedance 2.5 gibt es in zwei Stufen. Seedance 2.5 Turbo läuft in 720p oder 1080p für $0,20 bzw. $0,22 pro Sekunde. Standard-Seedance-2.5 läuft von 480p bis 4K und kostet in 720p $0,36 pro Sekunde. Beide akzeptieren denselben Prompt und denselben Start-Frame, der Wechsel vom Entwurf zum Final ist also ein Modellwechsel und keine Umschreibung.

Du kannst jede Hälfte austauschen. Googles Nano Banana Pro ist ein starkes Frame-Modell, wenn ein identisches Gesicht über viele Frames wichtiger ist als präzise Komposition, auch wenn es $0,14 pro Frame kostet. Alibabas Wan 3.0 ist mit $0,10 pro Sekunde der günstigste Weg, in 720p zu animieren. Die Vorlage nutzt standardmäßig GPT Image 2.5 Flare und Seedance 2.5 Turbo, weil dieses Paar zum Zeitpunkt des Schreibens die beste Frame-Präzision pro Dollar und die beste Bewegung pro Dollar liefert.

Ein Hinweis zu Sora 2

OpenAI hat die Video-API von Sora 2 am 24. September 2026 eingestellt. Ältere Storyboard-Tutorials, in denen Frames mit Sora 2 animiert werden, funktionieren über eine API nicht mehr. Seedance 2.5, Wan 3.0, Kling 3.0 und Veo 3.1 Fast sind heute die praktischen Optionen, um Storyboard-Frames zu animieren.

Shot-Liste schreiben: der Teil, den die meisten KI-Storyboards auslassen

Bevor ein Modell läuft, brauchst du eine Shot-Liste: die geordnete Menge der Einstellungen, was jede zeigt und warum sie existiert. Die meisten enttäuschenden KI-Kurzfilme sind keine Ausfälle des Modells. Es sind vier hübsche Bilder ohne Grund, in dieser Reihenfolge zu stehen.

Die Struktur aus vier Beats

Die Vorlage nutzt eine Struktur aus vier Beats, entlehnt aus Werbespots und Übungen der Filmausbildung. Sie ist klein genug, um in einer Sitzung produziert zu werden, und umfassend genug, um sich wie eine Geschichte anzufühlen.

ShotAufgabeBildausschnittWas der Zuschauer erfährt
1. EstablishingDie Welt zeigenWeit, große Schärfentiefe, Character klein bis mittelgroß im BildWo wir sind, welche Tageszeit, welche Stimmung
2. ActionDas Hauptereignis zeigenHalbnah, Hüfte aufwärts, ein klarer körperlicher BeatWas der Character will und tut
3. Close-upDas Gefühl zeigenGesicht und Hände, geringe SchärfentiefeWie sich der Character bei dem fühlt, was passiert ist
4. ResolutionDen Bogen schließenWeiter oder statisch, hält einen BeatWo der Character endet; die Stimmung hat sich verschoben

Der Fortschritt von weit über halbnah zu nah und wieder zurück ist keine Dekoration. So halten Cutter Zuschauer seit hundert Jahren orientiert. Eine weite Einstellung sagt dem Zuschauer, wo er ist. Der Schnitt näher heran sagt ihm, was zählt. Am Ende Abstand zu gewinnen gibt ihm Raum, das Finale zu spüren. Wenn du das Muster brichst, tu es bewusst: Eine Geschichte, die mit einer Nahaufnahme von Händen beginnt und den Raum erst in Einstellung zwei zeigt, kann funktionieren, aber nur, wenn die Beschreibung es verlangt.

Eine Aktion pro Einstellung

Ein Clip von fünf Sekunden trägt eine Aktion. „Sie dreht sich um, geht zur Tür, öffnet sie und schaut zurück“ sind vier Aktionen und werden als gehetztes Verwischen oder als mittendrin abbrechender Clip herauskommen. „Sie stößt die Tür mit der Schulter auf“ ist eine Aktion, die ein Videomodell in fünf Sekunden sauber animieren kann. Braucht deine Geschichte mehr, braucht sie mehr Einstellungen oder eine längere Dauer für die eine Einstellung.

Ein nützlicher Test: Beschreibe die Einstellung einem Freund in einem Satz mit einem Bewegungsverb. Wenn du „und dann“ brauchst, teile sie auf.

Kontinuitätsregeln zum Aufschreiben

Kontinuität ist das, was ein menschlicher Storyboard-Zeichner nebenbei erledigt und ein Modell gar nicht. Schreibe sie einmal in das Briefing, und der Shot-Texter überträgt sie in jede Einstellung:

  • Garderobe. Benenne jedes sichtbare Kleidungsstück und seine Farbe. „Gelbe Regenjacke, schwarze Cargohose, graue Kuriertasche quer über der Brust.“
  • Tageszeit und Wetter. „Nacht, leichter Regen, nasser Boden.“ Wenn es in Einstellung eins regnet und in Einstellung drei trocken ist, zerfällt die Sequenz.
  • Lichtquelle. „Neonschilder sind das Hauptlicht.“ Das hält die Farbe des Lichts konsistent.
  • Bildrichtung. Wenn sich der Character in Einstellung zwei von links nach rechts bewegt, sollte er in Einstellung vier nicht von rechts ankommen, es sei denn, er hat sich umgedreht. Schreibe „sie bewegt sich durch den ganzen Film von links nach rechts“, wenn die Richtung zählt.
  • Requisiten. Das Paket in Einstellung zwei muss dasselbe Paket sein wie in Einstellung vier.

Was du aus dem Briefing weglässt

Lass Dialog weg, weil ein Frame ihn nicht tragen kann und er das Videomodell zu Mundbewegungen verleitet, die zu keinem Audio passen. Lass eingeblendeten Text und Markennamen weg, weil Text in generierten Frames unzuverlässig ist und Logos rechtliche Probleme schaffen. Lass Kamerajargon im Briefing selbst weg: Der Shot-Texter ergänzt Objektiv und Licht pro Einstellung, und ein Briefing, das „anamorphotisches 35 mm“ vorschreibt, treibt jede Einstellung zum selben Bildausschnitt.

Character-Konsistenz über mehrere Frames

Konsistenz ist der Grund, überhaupt einen Storyboard-Workflow zu nutzen, und verdient deshalb einen eigenen Abschnitt. Es gibt drei Ebenen, und du willst alle drei.

Ein sauberes Setup für die Character-Referenz: ein erwachsenes Model, frontal bei weichem Studiolicht fotografiert, neben gedruckten Frames derselben Person in verschiedenen Szenen

Ebene 1: ein sauberes Referenzbild

Jeder Frame erhält dasselbe Referenzbild des Characters. Die Referenz sollte ein gut ausgeleuchtetes Porträt von vorn oder im Dreiviertelprofil sein, mit freiem Gesicht, neutralem Ausdruck und idealerweise der Garderobe, die du im Film willst. Ein Referenzfoto mit weißem Hemd kämpft gegen ein Briefing, das eine gelbe Jacke verlangt; das Modell muss entscheiden, was gilt, und entscheidet nicht jedes Mal gleich.

Wenn du auf MakeInfluencer.ai bereits einen KI-Influencer hast, übernimmt der Character-Knoten sein Referenzbild direkt. Wenn nicht, lade ein sauberes Porträt hoch. Der Leitfaden zur Erstellung konsistenter KI-Characters zeigt, wie du eine Referenz erstellst, die über viele Szenen hält, und der Leitfaden zur Character-Konsistenz erklärt die Kompromisse zwischen Referenzbildern und trainierten Modellen.

Ebene 2: die Identitätssperre im Prompt

Die Referenz allein reicht nicht; der Prompt muss dem Bildmodell sagen, was es damit tun soll. Der Prompt der Vorlage sagt im zweiten Satz: „Die Person im Referenzbild ist der Hauptcharacter: Gesicht, Haare, Hautton und Körperbau identisch zur Referenz halten.“ Diese Anweisung stellt die Referenz über alles in der Shot-Beschreibung, was du willst, wenn der Shot-Texter den Character nur locker beschreibt.

Ebene 3: der Frame ist die Referenz für den Clip

Wenn Seedance 2.5 einen Frame animiert, ist der Frame das Startbild. Das Modell beginnt bei genau diesen Pixeln, die Identität des Frames steckt also auch im ersten Frame des Clips. Drift im Clip entsteht durch Bewegung: eine Kopfdrehung, die ein Profil zeigt, das der Frame nie gezeigt hat, oder eine Nahaufnahme, die Details erfindet. Der Clip-Prompt wirkt dem entgegen mit „Character, Garderobe, Set und Beleuchtung genau wie im Frame halten“ und mit dem Verlangen nach einer Kamerabewegung statt dreien.

Prüfe die Gesichter, bevor du animierst

Lege die vier Frames nebeneinander und achte nur auf das Gesicht. Wenn das Gesicht in einem Frame nicht stimmt, generiere diesen Frame neu, bevor sein Clip läuft. Ein Gesicht in einem Frame für $0,039 zu korrigieren ist immer günstiger, als es in einem Clip für $1,00 zu entdecken.

Was trotzdem noch schiefgeht

Es ist nicht perfekt. Diese Fehler siehst du am häufigsten:

  • Profilaufnahmen. Ein frontales Referenzbild verrät dem Modell nicht, wie das Profil des Characters aussieht. Braucht eine Einstellung ein Profil, füge ein zweites Referenzbild von der Seite hinzu.
  • Sehr kleine Gesichter. In einer weiten Establishing-Einstellung kann das Gesicht 40 Pixel groß sein. Das Modell hat weniger zum Abgleichen, und es driftet stärker. In einer weiten Einstellung ist das meist akzeptabel; der Zuschauer liest Silhouette und Garderobe.
  • Hände und Requisiten. Hände, die Gegenstände halten, sind für Bild- und Videomodelle weiterhin eine Schwachstelle. Halte Handlungen einfach: halten, ablegen, stoßen. Vermeide alles, wofür Finger präzise interagieren müssen.

Kamerasprache, die die Ausgabe verändert

Beide Modelle verstehen gängige Begriffe aus dem Film, aber nicht jeder Begriff hat eine Wirkung. Das sind die Begriffe, die zuverlässig verändern, was du bekommst.

Eine Filmkamera auf einem Slider-Dolly auf einer regennassen Straße bei Nacht, im Hintergrund eine unscharfe Figur in gelber Jacke

Begriffe zum Bildausschnitt (für das Frame-Modell)

BegriffWas GPT Image 2.5 damit machtEinsatz
Extreme wide / establishing wideCharacter klein, Umgebung dominiertEinstellung 1
Full shotKopf bis Fuß im BildGarderobe und Körperhaltung zeigen
Medium shot / Hüfte aufwärtsOberkörper und Hände, lesbares GesichtEinstellung 2, die meiste Handlung
Medium close-upBrust aufwärtsReaktionen mit etwas Kontext
Close-upGesicht füllt den größten Teil des BildesEinstellung 3
Over-the-shoulderSchulter im Vordergrund, Motiv dahinterSzenen mit zwei Characters
UntersichtKamera unter Augenhöhe, Motiv wirkt starkMomente der Entschlossenheit
AufsichtKamera oben, Motiv wirkt kleinIsolation, Niederlage

Die Brennweite ist eine nützliche Abkürzung für die Perspektive. „24 mm“ liefert eine weite, leicht gestreckte Ansicht mit viel Umgebung. „35 mm“ ist die natürliche Standardperspektive fürs Erzählen. „50 mm“ kommt dem menschlichen Sehen nahe. „85 mm“ komprimiert den Hintergrund und isoliert ein Gesicht. Das Modell simuliert Optik nicht exakt, aber diese Zahlen verschieben den Bildausschnitt in die Richtung, die du erwartest.

Bewegungsbegriffe (für das Videomodell)

BegriffWas Seedance 2.5 damit machtGut für
Langsames Push-inKamera bewegt sich auf das Motiv zuSpannung aufbauen, Betonung
Pull-out / Dolly zurückKamera bewegt sich wegSchlüsse, Enthüllungen
Tracking Shot / FollowKamera bewegt sich mit dem MotivGehen, Laufen
Pan nach links oder rechtsKamera dreht sich um ihre AchseEinen Raum enthüllen
Tilt nach oben oder untenKamera schwenkt vertikalHöhe enthüllen
HandheldKleines organisches WackelnDringlichkeit, dokumentarisches Gefühl
Locked-off / statischKeine KamerabewegungDie Handlung trägt die Einstellung
OrbitKamera kreist um das MotivHero-Momente, sparsam eingesetzt

Die nützlichste Einzelregel: eine Kamerabewegung pro Einstellung. „Langsames Push-in bei gleichzeitigem Pan nach links und Tilt nach oben“ verlangt vom Modell, drei Bewegungen auf einmal zu lösen, und meist gelingt eine davon schlecht. Braucht eine Einstellung eine komplexe Bewegung, braucht sie wahrscheinlich zwei Einstellungen.

Die zweite Regel: Passe die Kamerabewegung an die Aufgabe der Einstellung an. Eine Establishing-Einstellung will einen langsamen Pan oder ein langsames Push-in, damit der Zuschauer Zeit hat, den Raum zu lesen. Eine Action-Einstellung will ein Follow oder Handheld. Ein Close-up will entweder gar nichts oder ein sehr langsames Push-in. Eine Resolution-Einstellung will ein Pull-out oder einen Locked-off-Frame, der dem Moment Raum zum Atmen gibt.

Prompt-Muster pro Shot-Typ

Die Vorlage setzt jeden Prompt aus zwei Teilen zusammen: der Shot-Beschreibung (pro Einstellung frisch vom Director-LLM geschrieben) und einer festen Spezifikation (identisch für alle vier Einstellungen). Im Canvas steht zuerst die Shot-Beschreibung, dann eine Leerzeile, dann die Spezifikation. Hier steht, was jeder Teil enthalten sollte, mit wiederverwendbaren Mustern.

Die Frame-Spezifikation (fest für alle Frames)

Das ist der genaue Text, den die Vorlage an jeden Frame anhängt:

Photoreal cinematic storyboard frame in 16:9. The person in the reference image is the lead character: keep face, hair, skin tone and build identical to the reference. Anamorphic feel on a 35mm lens, motivated natural light, fine film grain, muted graded palette. Compose the frame so it can be animated into a five-second shot. Avoid: on-screen text, captions, logos, watermarks, split screens, extra people, distorted hands.

Zwei Formulierungen leisten mehr, als man ihnen ansieht. „Compose the frame so it can be animated“ lenkt das Modell weg von erstarrten, überkomponierten Bildern hin zu Frames mit Platz für Bewegung. „Split screens“ in der Avoid-Liste verhindert, dass GPT Image 2.5 gelegentlich ein Storyboard mit mehreren Feldern in einem Bild zurückgibt, ein echter Fehlermodus, wenn das Wort „Storyboard“ im Prompt steht.

Die Clip-Spezifikation (fest für alle Clips)

Animate this storyboard frame as the shot described above. Keep the character, wardrobe, set and lighting exactly as in the frame. One clear camera move, natural believable motion, ambient sound design that matches the scene, no music, no on-screen text.

„No music“ ist Absicht. Vier Clips mit vier verschiedenen generierten Musikbetten lassen sich nicht zusammenschneiden. Umgebungston (Regen, Verkehr, Schritte, Raumton) schneidet sich sauber, und in jedem Editor kannst du eine Musikspur über die fertige Sequenz legen.

Muster für Shot-Beschreibungen

Jede Shot-Beschreibung sollte derselben Form aus drei Sätzen folgen: was wir sehen und wo der Character ist, was der Character tut, Bildausschnitt, Objektiv, Licht und Stimmung. Diese Muster taugen gut als Ausgangspunkte:

Establishing wide. „Weite Einstellung von [Ort] bei [Tageszeit], [Wetter]. [Character] ist [klein oder mittelgroß] im Bild, [eine ruhige Handlung, die den Ton setzt]. 24-mm-Objektiv, große Schärfentiefe, [Lichtquelle] als Hauptlicht, [Stimmung] Atmosphäre.“

Medium action. „Halbnah, Hüfte aufwärts, [Character] bei [einzelne körperliche Handlung] in [Teil des Ortes]. [Ein Detail, das Absicht oder Einsatz zeigt]. 35-mm-Objektiv, [Lichtquelle] von [Richtung], [Energiewort] Stimmung.“

Emotional close-up. „Nahaufnahme von [Character], Gesicht und Hände, bei [die Reaktion oder Erkenntnis]. [Eine Änderung im Ausdruck]. 85-mm-Objektiv, geringe Schärfentiefe, [motiviertes Licht], [Stimmung].“

Resolution. „[Weiterer oder statischer Bildausschnitt] von [Character] bei [Endposition oder Handlung] in [Ort]. [Wie sich Umgebung oder Licht seit Einstellung eins verändert haben]. [Objektiv], [Licht], die Stimmung hat sich zu [neue Stimmung] verschoben.“

Der Director-System-Prompt der Vorlage weist das LLM an, nur diese Art von Beschreibung aus zwei oder drei Sätzen auszugeben, ohne Überschriften, Listen oder Kommentar, und niemals Text, Untertitel oder Logos zu verlangen. Du kannst ihn in jedem Shot-Writer-Knoten bearbeiten.

Ein vollständiges Beispiel: vom Briefing zu vier Frames zu vier Clips

Hier ein kompletter Durchlauf mit jedem Prompt. Er nutzt die Standardeinstellungen der Vorlage: GPT Image 2.5 Flare in 16:9, 1K und mittlerer Qualität für die Frames und Seedance 2.5 Turbo in 720p, fünf Sekunden, Audio an für die Clips.

Das Briefing

Das ist der einzige Text, den du schreibst:

Story: Mara, a 30-year-old courier, races the last delivery of the night through a rain-soaked market street and finds the shop already closed, then leaves the parcel on the step with a handwritten note tucked under the string. Setting: night market street, neon signage, light rain, wet cobblestones. Wardrobe: yellow rain jacket, black cargo trousers, grey courier bag across the chest. Tone: melancholic. Do not change the character's look between shots.

Warum es funktioniert: ein Character, ein Ort, ein Bogen mit einem Ende, die Garderobe einmal benannt, die Stimmung einmal benannt. Briefings mit drei Orten oder zwei Hauptcharacters erzeugen Boards, die driften, weil jeder Frame unabhängig generiert wird und nur der Text und die Referenz sie verbinden.

Die vier Shot-Beschreibungen

Die vier Shot-Writer-Knoten erhalten jeweils das Briefing plus ihre Beat-Anweisung. Eine typische Ausgabe sieht so aus (das LLM läuft mit Temperatur 0,8, deine wird im Wortlaut abweichen):

Shot 1, establishing. "Wide shot of a narrow night market street glistening with rain, shuttered stalls and pink and teal neon signs reflecting in the wet cobblestones. Mara, in her yellow rain jacket with the grey courier bag across her chest, is small in the middle distance, jogging toward camera between the stalls. 24mm lens, deep focus, neon as the main light, cold melancholic atmosphere."

Shot 2, action. "Medium shot, waist-up, of Mara stopping short in front of a small shop with its metal shutter pulled down, one hand still gripping the brown paper parcel. Rain beads on her yellow hood and her breath shows in the cold air. 35mm lens, teal neon from the left, tense and deflated mood."

Shot 3, close-up. "Close-up of Mara's face and hands as she tucks a folded handwritten note under the string of the parcel, eyes lowered. A small, tired half-smile. 85mm lens, shallow depth of field, warm spill from a nearby lantern against the cold neon, quiet and tender."

Shot 4, resolution. "Static wide shot from across the street: the parcel sits alone on the shop's step under a small awning while Mara walks away to the right, her yellow jacket the only warm color in the frame. The rain has eased to a drizzle. 35mm lens, neon and lantern light, the mood has shifted from urgency to quiet acceptance."

Beachte, was das LLM aus dem Briefing übernommen hat, ohne dass es noch einmal gesagt wurde: die gelbe Jacke, die graue Tasche, das Neon, der Regen. Deshalb hat das Briefing sie einmal deutlich benannt.

Die vier Frames

Jeder Frame-Knoten erhält seine Shot-Beschreibung, die nach einer Leerzeile angehängte Frame-Spezifikation und das Character-Referenzbild. Der vollständige Prompt für Frame 2, genau wie gesendet, lautet:

Medium shot, waist-up, of Mara stopping short in front of a small shop with its metal shutter pulled down, one hand still gripping the brown paper parcel. Rain beads on her yellow hood and her breath shows in the cold air. 35mm lens, teal neon from the left, tense and deflated mood.

Photoreal cinematic storyboard frame in 16:9. The person in the reference image is the lead character: keep face, hair, skin tone and build identical to the reference. Anamorphic feel on a 35mm lens, motivated natural light, fine film grain, muted graded palette. Compose the frame so it can be animated into a five-second shot. Avoid: on-screen text, captions, logos, watermarks, split screens, extra people, distorted hands.
Vier von GPT Image 2.5 gezeichnete Storyboard-Frames für die Vorlage Storyboard to Film

Prüfe die vier Frames vor jedem Clip anhand einer kurzen Checkliste:

  • Ist das Gesicht in allen vieren dieselbe Person?
  • Ist die Garderobe identisch, einschließlich der Farben?
  • Ist die Lichtquelle konsistent (hier Neon, nicht Tageslicht)?
  • Zeigt jeder Frame genau eine Handlung mit Raum zum Animieren?
  • Hat sich Text, ein Logo oder eine zusätzliche Person eingeschlichen?

In einem typischen Lauf braucht einer von vier Frames einen zweiten Versuch. Am häufigsten betrifft es die weite Establishing-Einstellung, in der der Character klein ist und das Modell einer Marktstraße manchmal zusätzliche Figuren hinzufügt. Lass nur diesen einen Frame-Knoten noch einmal laufen; die anderen drei bleiben, wie sie sind.

Die vier Clips

Jeder Clip-Knoten erhält den Frame als Start-Frame und die Shot-Beschreibung plus die Clip-Spezifikation als Prompt. Der vollständige Prompt für Clip 2 lautet:

Medium shot, waist-up, of Mara stopping short in front of a small shop with its metal shutter pulled down, one hand still gripping the brown paper parcel. Rain beads on her yellow hood and her breath shows in the cold air. 35mm lens, teal neon from the left, tense and deflated mood.

Animate this storyboard frame as the shot described above. Keep the character, wardrobe, set and lighting exactly as in the frame. One clear camera move, natural believable motion, ambient sound design that matches the scene, no music, no on-screen text.

Wenn du die Bewegung genauer steuern willst als mit „eine klare Kamerabewegung“, füge dem Prompt des Clip-Knotens selbst eine Zeile hinzu. Für diese Sequenz:

ClipErgänzte BewegungszeileWarum
1"Slow push-in as she jogs toward camera, footsteps splashing."Zieht den Zuschauer in die Straße
2"Handheld, slight shake, she exhales and her shoulders drop."Dringlichkeit kippt in Enttäuschung
3"Locked-off, only her hands and eyes move."Lässt die kleine Geste die Einstellung tragen
4"Slow pull-out while she walks out of frame to the right."Lässt das Paket am Ende allein zurück

Der Clip oben ist ein echtes Seedance-2.5-Turbo-Rendering von Bild zu Video aus einem der Frames der Vorlage. Vier Clips hintereinander ergeben einen Film von 20 Sekunden. Schneide sie in einem beliebigen Editor zusammen, lege eine einzelne Musikspur darunter, und du hast einen Kurzfilm mit einem konsistenten Character, einem Ort und einem vollständigen Bogen.

Einen schlechten Clip beheben

Wenn sich ein Clip danebenbenimmt, stelle die Diagnose, bevor du neu würfelst:

  • Das Gesicht driftet mitten im Clip. Meist verursacht durch eine Kopfdrehung. Ergänze „she keeps her face toward camera“ oder wähle eine Kamerabewegung, die keinen neuen Winkel offenbart.
  • Es passiert zu viel. Die Shot-Beschreibung enthält zwei Handlungen. Kürze sie auf eine.
  • Es passiert nichts. Der Frame ist überkomponiert. Generiere den Frame mit offenerer Komposition neu oder füge dem Clip eine ausdrückliche Handlungszeile hinzu.
  • Falscher Ton. Benenne den Ton: „rain on the awning, distant traffic, no voices.“
  • Der Clip ist für die Handlung zu kurz. Erhöhe die Dauer des Knotens auf 8 oder 10 Sekunden. Seedance 2.5 akzeptiert 4 bis 30 Sekunden.

Was es kostet, Zeile für Zeile

Alle Zahlen unten sind Listenpreise der Anbieter aus dem Preis-Manifest von MakeInfluencer.ai, geprüft am 29. September 2026. Die Spalte mit den Credits nutzt die aktuelle Umrechnung der Plattform; der Run-Button im Canvas zeigt vor dem Start die genaue Summe.

SchrittModell und EinstellungenAnzahlListenpreis pro StückCa. Credits pro Stück
Shot-TexteDirector-LLM4ein Bruchteil eines Cents1.000
FramesGPT Image 2.5 Flare, 1K mittel, mit Character-Referenz4$0,0391.955
ClipsSeedance 2.5 Turbo, 720p, 5 s, Audio an4$1,0050.126
Gesamt pro Laufetwa $4,16etwa 212.000

Frames mit Character-Referenz nutzen die Bearbeitungspreise von GPT Image 2.5 ($0,039 bei 1K mittel) statt des einfachen Text-zu-Bild-Preises ($0,024), weil das Referenzbild eine Eingabe ist. Jede weitere Referenz über die erste hinaus kostet $0,015 zusätzlich.

Die Clips machen 96 Prozent der Rechnung aus. Das ist das ganze Argument dafür, zuerst das Board freizugeben.

Wege nach oben und nach unten

ÄnderungNeue Clip-Kosten (5 s)Summe für vier ClipsWann es sich lohnt
Standard: Seedance 2.5 Turbo 720p$1,00$4,00Entwürfe, Social-Schnitte
Seedance 2.5 Turbo 1080p$1,10$4,40Finaler Schnitt für die meisten Plattformen
Standard-Seedance-2.5 720p$1,80$7,20Hero-Einstellungen mit komplexer Bewegung
Standard-Seedance-2.5 1080p$4,50$18,00Lieferungen an Kunden
Wan 3.0 720p$0,50$2,00Läufe mit kleinem Budget, einfache Bewegung
Kling 3.0 Pro mit Ton$0,84$3,36Wenn du Klings Bewegungsstil bevorzugst
Gemini Omni 1.1 Flash 360p$0,15$0,60Nur für Bewegungstests

Ein vernünftiges gemischtes Setup: Turbo 720p für die Einstellungen 1, 3 und 4 und Standard-Seedance-2.5 in 720p für die Action-Einstellung. Das sind $4,80 für die Clips, und der Mehraufwand fließt dorthin, wo die Bewegung am schwierigsten ist.

Auf der Frame-Seite kostet es $0,105 pro Frame mit Referenz, die Qualität in 1K auf hoch zu setzen, was neben den Clips immer noch unerheblich ist. Nutze es, wenn du ein Posterbild aus einem Frame ziehen willst.

Der Entwurfs-Workflow: Bewegung günstig testen, bevor du dich festlegst

Seedance 2.5 Turbo ist schon die Budget-Stufe, aber für ein Board, das du stark iterieren willst, gibt es einen noch günstigeren ersten Durchgang. Googles Gemini Omni 1.1 Flash rendert Clips von 3 bis 10 Sekunden in 360p für $0,03 pro Sekunde, ein Bewegungstest von fünf Sekunden kostet also $0,15, etwa 7.500 Credits. Es unterstützt Start-Frames, und das Audio ist immer an.

Der Workflow, den manche Plattformen als „Draft Mode“ verkaufen, besteht nur aus drei Durchgängen:

1

Durchgang für die Frames

Lass nur Briefing, Shot-Writer und Frames laufen. Gib alle vier Frames frei. Kosten: etwa $0,16 zum Listenpreis.

2

Bewegungsdurchgang in 360p

Stelle jeden Clip-Knoten auf Gemini Omni 1.1 Flash in 360p, fünf Sekunden. Achte auf Kamerabewegungen, die schlechte Winkel offenbaren, Handlungen, die nicht passen, und auf das Timing. Passe die Bewegungszeilen an. Kosten: $0,60 für vier Clips.

3

Finaler Durchgang

Stelle die Clip-Knoten wieder auf Seedance 2.5 Turbo in 720p oder 1080p, oder für die Hero-Einstellung auf Standard-Seedance-2.5, und lass sie laufen. Kosten: $4,00 bis $7,20 je nach Mischung.

Der Vorbehalt ist ehrlich gemeint: Ein Entwurf in 360p von einem anderen Modell sagt dir etwas über Komposition, Tempo und Kamerabewegung, aber nicht darüber, wie genau Seedance 2.5 die Bewegung rendern wird. Sein Wert liegt darin, Fehler zu finden, die unabhängig vom Modell sind, etwa die Handlung, die acht statt fünf Sekunden braucht, oder das Push-in, das den Kopf des Characters abschneidet. Bei Boards, die du schon einmal laufen lassen hast, überspringst du den Bewegungsdurchgang und gehst direkt zu Turbo.

Zeitbedarf: Plane mit Minuten, nicht mit Sekunden

Frames mit GPT Image 2.5 Flare brauchten in unseren Tests im September 2026 etwa 27 Sekunden pro Frame. Seedance 2.5 ist langsamer, als das Datenblatt nahelegt. In unserem Live-Test brauchte ein Turbo-Clip von Bild zu Video mit 4 Sekunden in 720p in der Startwoche etwa neun Minuten von der Übermittlung bis zur fertigen Datei, größtenteils offenbar Wartezeit in der Warteschlange beim Anbieter. Plane für einen vollständigen Lauf 10 bis 20 Minuten ein und mach währenddessen etwas anderes. Du kannst den Tab schließen; Canvas läuft weiter, und die Ergebnisse landen in den Knoten.

KI-Storyboard-Generatoren im Vergleich

Diese Tools überschneiden sich auf unterschiedliche Weise mit dem Workflow Storyboard to Film. Die Funktionsangaben unten haben wir im September 2026 auf den öffentlichen Seiten der Anbieter geprüft; wo ein Anbieter etwas öffentlich nicht angibt, sagt die Tabelle das.

ToolFramesMacht aus Frames VideoCharacter-KonsistenzHinweise
MakeInfluencer.ai Storyboard to FilmGPT Image 2.5 Flare oder Sunburst, Nano Banana Pro, andereJa, im selben Lauf: Seedance 2.5, Seedance 2.5 Turbo, Wan 3.0, Kling 3.0, Gemini OmniDein KI-Influencer oder ein Referenzfoto, in jeden Frame eingespeistDashboard, Canvas, REST-API, MCP; Credit-Kosten vor jedem Lauf sichtbar
Higgsfield PopcornEigenes Storyboard-Modell, bis zu 8 Frames, bis zu 4 ReferenzenFrames werden als Start-Frames für separate Videomodelle wie Kling oder Veo genutztReferenzen plus konsistente SequenzgenerierungApp; Credits vor der Generierung sichtbar
LTX StudioSkript in Szenen und Einstellungen aufgeteilt; Frames mit FLUX oder Nano BananaJa: LTX-eigene Modelle, dazu Partnermodelle, die unabhängige Reviews als Kling, Seedance und Veo aufführenCharacters und Objekte als wiederverwendbare „Elements“ gespeichertApp für Pre-Visualisierung und Pitch-Decks
BoordsSkizzen, Vektor oder fotorealistische Frames aus einem SkriptNein, keine Videoclips; Animatics mit Audio zur Timing-PrüfungCast, Orte und Requisiten einmal benennen und mit @ referenzierenFür Agenturen und Marken-Teams gebaut
StoryboardHeroFrames mit Titel, Beschreibung, Handlung und Voice-over pro FrameExport als MP4-Animatic, kein generiertes VideoKein Kernmerkmal auf den öffentlichen SeitenZielgruppe Marketing und Social Video

So liest du die Tabelle: Wenn du einem Kunden nur ein Board zeigen musst, sind Boords und StoryboardHero genau dafür gebaut und enthalten Prüf-Werkzeuge, die den anderen fehlen. Wenn du ein durchgängiges Film-Tool mit Timeline willst, ist LTX Studio das vollständigste. Higgsfield Popcorn erzeugt längere Boards (bis zu acht Frames) mit starker Konsistenz in der App, übergibt die Animation aber an einen separaten Schritt. Der Vorteil der Vorlage Storyboard to Film für Creator ist enger gefasst und konkret: Das Board geht von einem Character aus, den du schon hast, Frames und Clips laufen in einem Graphen, und jeder Knoten lässt sich gegen jedes Modell der Plattform austauschen.

Für einen breiteren Blick auf Higgsfields Werkzeuge siehe den Leitfaden zu Higgsfield-Alternativen. Zu den Kompromissen zwischen Videomodellen im Allgemeinen siehe beste KI-Video-Generatoren 2026.

Die Version mit einem Klick: Storyboard to Film im AI Canvas

Die Vorlage Storyboard to Film verdrahtet alles oben zu einem einzigen Lauf. Öffne den AI Canvas, wähle die Vorlage aus den Filmmaker-Vorlagen, wirf dein Briefing in den ersten Knoten und deinen Character in den zweiten und drücke auf Run.

Was genau läuft:

  • 1 Story-Brief-Knoten, vorausgefüllt mit einer Lückenvorlage für Geschichte, Schauplatz, Garderobe und Ton.
  • 1 Character-Knoten, mit jedem Frame-Knoten als Gesichtsreferenz verbunden.
  • 4 Shot-Writer-LLM-Knoten, jeweils mit dem Director-System-Prompt und einer eigenen Beat-Anweisung (Establishing, Action, Close-up, Resolution), Temperatur 0,8, bis zu 160 Tokens.
  • 4 Frame-Knoten mit GPT Image 2.5 Flare in 16:9, 1K, mittlerer Qualität, eine Ausgabe pro Knoten.
  • 4 Clip-Knoten mit Seedance 2.5 Turbo in 720p, fünf Sekunden, Audio an. Jeder erhält seinen Frame als Start-Frame und seine Shot-Beschreibung als Prompt.

Jeder Knoten ist bearbeitbar. Häufige Änderungen:

  • Stelle einen Clip-Knoten für die Hero-Einstellung auf Standard-Seedance-2.5 und 1080p.
  • Erhöhe die Dauer bei der Action-Einstellung auf 8 oder 10 Sekunden.
  • Wechsle einen Frame-Knoten zu GPT Image 2.5 Sunburst, wenn du eine präzise Bearbeitung eines vorhandenen Standbilds brauchst statt eines frischen Frames.
  • Setze die Qualität des Frames auf hoch, wenn du ein Standbild in Postergüte willst.
  • Bearbeite den Director-System-Prompt in allen vier Shot-Writern, um den Hausstil zu ändern, zum Beispiel „documentary, handheld, available light“.

Gib das Board frei, bevor die Clips laufen

Lass die Vorlage einmal laufen, prüfe die vier Frames und generiere nur die neu, die danebenliegen. Jeder Clip liest den aktuellen Frame; einen Frame zu korrigieren und seinen Clip neu laufen zu lassen kostet also einen Clip, nicht vier.

Über vier Einstellungen hinaus

Vier Einstellungen sind eine Ausgangsform, keine Grenze. So erweiterst du:

  • Mehr Beats. Dupliziere eine Kette aus Shot-Writer, Frame und Clip und gib dem neuen Shot-Writer seine eigene Beat-Anweisung („Write SHOT 5, the reaction of a second character...“). Verbinde die Knoten für Briefing und Character mit ihr.
  • Längere Einstellungen. Jeder Clip kann mit Seedance 2.5 bis zu 30 Sekunden lang sein. Darüber hinaus nutzt du Seedance 2.5 Video Extend über die API, um einen Clip ab seinen letzten 30 Sekunden fortzusetzen.
  • Mehrere Szenen. Lass die Vorlage einmal pro Szene laufen, mit einem szenenspezifischen Briefing und demselben Character. Halte die Zeilen zu Garderobe und Ton in allen Briefings identisch.
  • Hochkant-Schnitte. Stelle die Frame-Knoten auf 9:16 um. Clips von Bild zu Video folgen der Form des Start-Frames, die ganze Kette geht damit für Reels und TikTok ins Hochformat.

Dieselbe Pipeline über die API bauen

Alles in der Vorlage ist über die REST-API von MakeInfluencer.ai verfügbar, was nützlich ist, wenn du viele Boards aus einem Briefing in einer Tabelle generieren willst. Der Ablauf:

  1. Generiere jeden Frame mit gpt-image-2.5-flare und übergib dein Character-Bild in imageUrls.
  2. Frage /generations/image/{id} ab, bis terminal true ist, und übernimm die URL.
  3. Übermittle jeden Clip an seedance25turbo mit der Frame-URL als startFrameUrl. Die API wählt automatisch Bild-zu-Video, wenn ein Start-Frame vorhanden ist.
  4. Frage /generations/video/{id} ab, bis terminal true ist.

Der Seedance-2.5-API-Leitfaden enthält vollständige Beispiele für Anfragen und Antworten, und die Seite zur GPT Image 2.5 Flare API listet jeden Frame-Parameter auf. Credits teilen sich Dashboard, Canvas und API, und preview-credits liefert die genauen Kosten jeder Anfrage, ohne etwas abzubuchen.

Häufig gestellte Fragen

Was ist ein KI-Storyboard-Generator?

Ein Tool, das ein Skript oder Briefing in eine Folge von Standbildern verwandelt, eines pro Einstellung, damit du ein Video vor der Produktion planen und freigeben kannst. Storyboard-zu-Video-Tools wie die Vorlage Storyboard to Film ergänzen den Produktionsschritt: Jeder freigegebene Frame wird zu einem Clip animiert.

Kann ich auf diese Weise mit KI einen Kurzfilm machen?

Ja. Ein Lauf erzeugt vier Clips von fünf Sekunden, eine Sequenz von 20 Sekunden mit einem Character und einem vollständigen Bogen. Erhöhe die Dauer, füge Shot-Ketten hinzu oder lass die Vorlage für längere Filme einmal pro Szene laufen. Spielfilmlänge erzeugt kein aktuelles Videomodell in einem Durchgang; Kurzfilme von einer bis drei Minuten sind mit mehreren Läufen und einem Editor realistisch.

Was ist für Storyboard-Frames besser, GPT Image 2.5 oder Nano Banana Pro?

GPT Image 2.5 Flare folgt Anweisungen zum Bildausschnitt präziser und kostet $0,039 pro Frame mit Referenz gegenüber $0,14 bei Nano Banana Pro. Nano Banana Pro hält manchmal ein identisches Gesicht über viele Frames besser. Probiere beide bei Einstellung eins und behalte, was zu deinem Character passt. Der Vergleich GPT Image 2.5 gegen Nano Banana Pro geht tiefer.

Bleibt der Character über die vier Clips konsistent?

Die Character-Referenz geht in jeden Frame, und Seedance 2.5 animiert genau den Frame, den es bekommt, die Ähnlichkeit hält daher deutlich besser, als wenn du Video allein aus Text promptest. Perfekt ist es nicht: Kopfdrehungen und sehr kleine Gesichter driften am häufigsten. Prüfe die vier Frames nebeneinander und generiere jeden Frame mit falschem Gesicht neu, bevor sein Clip läuft.

Wie lange dauert ein Lauf?

Frames brauchen jeweils etwa eine halbe Minute. Clips dauern länger: In unserem Test in der Startwoche brauchte ein einzelner Clip mit Seedance 2.5 Turbo etwa neun Minuten. Plane pro Lauf 10 bis 20 Minuten ein.

Kann ich meine eigenen Storyboard-Skizzen in Video verwandeln?

Ja, mit einem zusätzlichen Schritt. Füge einen Bild-Eingabeknoten mit deiner Skizze hinzu, verbinde ihn mit einem Frame-Knoten und bitte GPT Image 2.5 Sunburst, sie mit deiner Character-Referenz fotorealistisch zu rendern und die Komposition beizubehalten. Animiere dann den gerenderten Frame. Wer eine Bleistiftskizze direkt mit einem Videomodell animiert, bekommt meist eine bewegte Skizze, und das ist selten das, was du willst.

Was kostet das?

Etwa $4,16 zum Listenpreis der Anbieter für den Standardlauf mit vier Frames und vier Clips, in Credits auf dem Run-Button angezeigt, bevor du startest. Die Frames machen etwa 4 Prozent davon aus. Wenn du alle vier Clips auf Standard-Seedance-2.5 in 720p hochstufst, steigt die Summe auf etwa $7,36.

Gibt es einen kostenlosen Weg, es auszuprobieren?

Nicht für die vollständige Vorlage: Frames und Clips laufen über Credits, und neue Konten bekommen keine kostenlosen Credits, prüfe also die Preisseite für aktuelle Tarife. Kostenlos kannst du einzelne Frames auf der Seite des KI-Storyboard-Generators skizzieren, die unser eigenes offenes Bildmodell ohne Konto nutzt. Es erreicht nicht die Qualität der Frames von GPT Image 2.5, reicht aber, um Bildausschnitt und Objektiv zu testen, bevor du Credits ausgibst.

Starte dein erstes Board

1

Konto erstellen und Tarif wählen

Melde dich bei MakeInfluencer.ai an und wähle auf der Preisseite einen Tarif oder ein Credit-Bundle.

2

AI Canvas öffnen und Storyboard to Film wählen

Füge ein Briefing aus einem Absatz mit Geschichte, Schauplatz, Garderobe und Ton ein, wähle deinen Character und drücke auf Run.

3

Frames freigeben, dann die Clips fertigstellen

Generiere Frames neu, die danebenliegen, stufe die Hero-Einstellung auf Standard-Seedance-2.5 hoch und schneide die vier Clips mit einer Musikspur zusammen.

Öffne den AI Canvas, um die Vorlage laufen zu lassen, probiere einzelne Einstellungen im KI-Video-Generator oder lies den Seedance-2.5-API-Leitfaden, um dieselbe Pipeline in Code zu bauen. Fragen: [email protected].

Bereit, es selbst auszuprobieren?

Beginne mit der Erstellung von KI-Influencern und generiere Inhalte in Minuten.