Una idea → un cortometraje
Crear película

Mejor IA de imagen a video en 2026: 10 modelos y apps comparados

Comparativa honesta de los mejores modelos y apps de imagen a video con IA en 2026: Seedance 2.5, Kling 3.0, Wan 3.0, Veo 3.1 y más, con precios por segundo.

Guía42 min de lectura

Crea tu Influencer IA

Únete a más de 300.000 creadores que ganan con contenido generado por IA. Sin conocimientos técnicos.

Empezar a crear

La mejor IA de imagen a video es la que mantiene tu imagen intacta mientras se mueve. Suena obvio, pero es la prueba que la mayoría de las comparativas se saltan. Un modelo de texto a video se juzga por su imaginación; uno de imagen a video, por su contención. Ya elegiste la cara, el producto, la luz y el encuadre cuando creaste la imagen fija. El trabajo del modelo es añadir un movimiento creíble sin redibujar nada.

Esta guía compara diez opciones: seis modelos de vanguardia que pagas por segundo (Seedance 2.5 de ByteDance y su versión Turbo, Kling 3.0 de Kuaishou, Wan 3.0 y Wan 2.6 Flash de Alibaba, Veo 3.1 y Gemini Omni 1.1 Flash de Google) y cuatro apps de consumo que la gente busca junto a ellos (Runway, Luma, Pika y Hailuo). Para cada modelo que alojamos, las duraciones, resoluciones, audio y compatibilidad con fotograma final que aparecen abajo proceden de las definiciones de modelo que hacen funcionar el producto, y los precios son los de lista del proveedor, tomados de nuestro manifiesto de precios y verificados el 29 de septiembre de 2026 salvo que se indique lo contrario. Los planes de apps de terceros se verificaron en la página de precios pública de cada proveedor y están marcados como "verificados en septiembre de 2026". Cuando no pudimos confirmar una cifra en la página del proveedor, lo decimos en lugar de adivinar.

Una fotografía de retrato impresa en un escritorio junto a un monitor que muestra el mismo fotograma animado como una secuencia de video

Ilustración editorial del flujo de trabajo de imagen a video; no es una captura de pantalla de ningún producto.

Divulgación del editor

MakeInfluencer.ai publica esta guía y aloja siete de los modelos comparados (Seedance 2.5, Seedance 2.5 Turbo, Kling 3.0, Wan 3.0, Wan 2.6 Flash, Veo 3.1 Fast y Gemini Omni 1.1 Flash) en su estudio y su API. No creamos ninguno de estos modelos; los desarrollan ByteDance, Kuaishou, Alibaba y Google. Describimos las apps de terceros usando solo lo que dicen sus páginas públicas y señalamos sus puntos fuertes incluso donde compiten con nosotros. Lee las recomendaciones con eso en mente y usa la prueba de una tarde que aparece hacia el final de la página para comprobarlas tú mismo.

Una nota sobre Sora 2: OpenAI retiró su API de Videos el 24 de septiembre de 2026, así que no recomendamos Sora 2 ni Sora 2 Pro en ninguna parte de esta guía. Si una comparativa que estás leyendo todavía sitúa a Sora 2 como opción de producción para imagen a video, se escribió antes de esa retirada.

La respuesta breve

Si solo tienes un minuto, así se ordena el panorama en septiembre de 2026:

  • Mejor calidad general y control: Seedance 2.5 de ByteDance. Hasta 30 segundos por generación, de 480p a 4K, audio nativo y fotogramas de inicio y fin. También es el más caro por segundo.
  • Mejor forma de iterar en Seedance: Seedance 2.5 Turbo, con el mismo rango de 4 a 30 segundos a 720p o 1080p, por $0.20 a $0.22 por segundo en lugar de $0.36 a $0.90.
  • Mejor precio por segundo con audio: Wan 3.0 de Alibaba. De 2 a 30 segundos, audio nativo, control de fotograma final y $0.10 por segundo a 720p.
  • Movimiento más barato: Wan 2.6 Flash de Alibaba, a $0.025 por segundo a 720p sin audio. Es la forma más barata de comprobar si una imagen fija se anima bien en el estudio de imagen a video.
  • Mejor para planos cortos y controlados de personajes: Kling 3.0 de Kuaishou, con duraciones de 3, 5, 10 y 15 segundos, prompts negativos y una capa de sonido opcional.
  • Mejor para clips pulidos de 8 segundos con sonido: Veo 3.1 Fast de Google, con 4, 6 u 8 segundos a 720p o 1080p.
  • Mejor borrador barato: Gemini Omni 1.1 Flash de Google a 360p por $0.03 por segundo; luego vuelve a renderizar el ganador a 720p, 1080p o 4K.
  • Mejor app de edición construida en torno a su propio modelo: Runway, que combina Gen-4.5 con un editor y una asignación inicial gratuita.
  • Mejores suscripciones multimodelo: Luma y Pika ya revenden modelos de terceros, entre ellos Seedance 2.5, junto con los suyos.
  • Merece la pena probar para baile y movimiento expresivo: Hailuo de MiniMax, cuyo sitio ahora destaca el modelo MiniMax H3.
$0.125
5 s a 720p, Wan 2.6 Flash $1.00 5 s a 720p, Seedance 2.5 Turbo 30 s Clip único más largo, Seedance 2.5 y Wan 3.0 $0.025 Por segundo, Wan 2.6 Flash a 720p sin audio

Cómo comparamos la IA de imagen a video

Todas las herramientas de esta lista pueden animar una foto. Las diferencias que importan en la práctica son menores de lo que sugiere el marketing, así que evaluamos cada opción según seis criterios.

  1. Conservación de la identidad. ¿La cara, la etiqueta del producto o el logo se mantienen iguales del primer fotograma al último? Es la propiedad más importante en imagen a video y la que falla con más frecuencia.
  2. Calidad del movimiento. ¿Las manos, la tela y el pelo son físicamente plausibles? ¿La cámara se mueve como una cámara real o flota?
  3. Duración por generación. Los clips cortos son baratos de corregir. Los largos ahorran tiempo de edición, pero multiplican el costo de un error.
  4. Resolución y relación de aspecto. 9:16 para TikTok, Reels y Shorts; 16:9 para YouTube y web; 1:1 o 4:5 para feeds y fichas de producto.
  5. Audio. El audio nativo (sonido ambiente, pasos, diálogos) te ahorra un paso de diseño de sonido, pero lo pagas y a menudo acabas reemplazándolo.
  6. Control del fotograma final. Dar un fotograma de inicio y otro final convierte la generación de una lotería en una interpolación. Es la función menos aprovechada de la categoría.

El precio es el séptimo criterio, y el más fácil de medir. Los modelos de vanguardia se facturan por segundo de salida, así que indicamos el precio de lista del proveedor por segundo y el costo de un clip representativo. MakeInfluencer.ai convierte esos precios en créditos y muestra el costo exacto en créditos antes de cada generación; la tarifa completa está en la guía de precios de modelos de video con IA.

Tabla comparativa de IA de imagen a video

Las filas de modelos usan el precio de lista del proveedor verificado el 29 de septiembre de 2026 (los precios de Kling 3.0 y Veo 3.1 Fast se verificaron por última vez el 21 de mayo de 2026). Las filas de apps muestran el plan de pago más barato de la página de precios del proveedor, verificado en septiembre de 2026.

OpciónFabricanteDuración del clip (i2v)ResoluciónAudioFotograma finalPrecio
Seedance 2.5ByteDance4 a 30 s480p, 720p, 1080p, 4KNativo, activado por defectoSí$0.18 / $0.36 / $0.90 / $1.80 por s
Seedance 2.5 TurboByteDance4 a 30 s720p, 1080pNativo, activado por defectoSí$0.20 / $0.22 por s
Kling 3.0 Standard y ProKuaishou3, 5, 10 o 15 sNiveles Standard y ProSonido opcional, cuesta 1.5xSíStd $0.084 por s sin audio, Pro $0.112 por s sin audio
Wan 3.0Alibaba2 a 30 s480p, 720p, 1080pNativo, activado por defectoSí$0.05 / $0.10 / $0.20 por s
Wan 3.0 PrimeAlibaba2 a 30 s480p, 720p, 1080pNativoSí$0.075 / $0.15 / $0.30 por s
Wan 2.6 FlashAlibaba2 a 15 s720p, 1080pOpcional, duplica el precioNo$0.025 por s a 720p sin audio
Veo 3.1 FastGoogle4, 6 u 8 s720p, 1080pOpcionalSí$0.10 por s sin audio, $0.15 con audio
Gemini Omni 1.1 FlashGoogle3 a 10 s360p, 720p, 1080p, 4KSiempre activadoSí$0.03 / $0.10 / $0.15 / $0.30 por s
RunwayRunwayDepende del modeloDepende del modeloDepende del modeloDepende del modeloGratis: 125 créditos únicos. Standard $15/mes ($12/mes anual)
LumaLuma AIDepende del modeloDepende del modeloDepende del modeloDepende del modeloSin plan gratuito. Plus $30/mes ($25/mes anual)
PikaPikaDepende del modeloDepende del modeloDepende del modeloDepende del modeloPlan gratuito sin créditos mensuales (solo paquetes de crédito). Starter $10/mes
HailuoMiniMaxNo indicado en la página de inicioNo indicado en la página de inicioNo indicadoNo indicadoLos planes no se podían leer en la página del proveedor cuando se verificó

Destacan tres patrones. Primero, la dispersión de precios es enorme: un clip de 5 segundos a 720p cuesta $0.125 en Wan 2.6 Flash y $1.80 en Seedance 2.5, una diferencia de 14 veces para la misma duración. Segundo, solo Seedance 2.5 y Wan 3.0 llegan a 30 segundos en una pasada de imagen a video. Tercero, las apps de consumo venden cada vez más modelos de otras empresas: las páginas de precios de Luma y Pika incluyen Seedance 2.5, y la de Runway incluye Seedance 2.0 y Kling 3.0 junto a su Gen-4.5. Al elegir una app, a menudo eliges tanto un modelo como un envoltorio de facturación e interfaz.

1. Seedance 2.5 (ByteDance): el mejor en general

Seedance 2.5 es el modelo al que recurriríamos primero cuando el plano importa. En modo imagen a video recibe un fotograma de inicio y otro final opcional, genera de 4 a 30 segundos de una sola vez y produce 480p, 720p, 1080p o 4K. El audio nativo viene activado por defecto. La relación de aspecto sigue la de tu imagen de inicio.

Lo que hace mejor que nada de esta lista es mantener una composición a lo largo de un clip largo. En un plano de 20 segundos de una persona que camina hacia la cámara por una calle concurrida, es mucho más probable que la cara, la chaqueta y el fondo lleguen intactos al último fotograma que con los modelos económicos, que es justo donde suelen fallar los clips largos de imagen a video. También maneja acciones encadenadas descritas en un prompt ("ella levanta la taza, da un sorbo, la deja y mira por la ventana") sin fundir los pasos entre sí.

Precio. El precio de lista del proveedor es $0.18 por segundo a 480p, $0.36 a 720p, $0.90 a 1080p y $1.80 a 4K. Un clip de 5 segundos a 720p cuesta $1.80; uno de 10 segundos a 1080p, $9.00. Seedance 2.5 se factura solo por la salida, así que el audio no aumenta el precio.

Imágenes de referencia. Seedance 2.5 acepta hasta 30 imágenes de referencia, a las que el prompt se refiere como @Image 1, @Image 2 y así sucesivamente. En MakeInfluencer.ai esas referencias guían la ruta de texto a video; en cuanto subes un fotograma de inicio, este (y el fotograma final opcional) es lo que ancla la identidad. Si necesitas que un personaje aparezca en una escena nueva de la que no tienes una imagen fija, genera primero la escena con referencias, o crea la imagen fija con GPT Image 2.5 y luego anímala.

Dónde se queda corto. El costo. A 1080p es la opción más cara por segundo de la lista, e iterar un prompt a precio completo quema presupuesto rápido. Varios proveedores también describen los niveles de 1080p y 4K como reescalados desde una resolución nativa menor, así que considera 720p la resolución de trabajo natural para redes sociales.

Mejor para. Planos principales, planos largos únicos, escenas protagonizadas por personajes y todo lo que se vaya a ver a pantalla completa. La guía de la API de Seedance 2.5 cubre los cinco modos de Seedance 2.5, incluidos Video Extend y Talking Avatar.

Un clip de imagen a video de Seedance 2.5 Turbo animado a partir de un fotograma de storyboard creado con GPT Image 2.5.

2. Seedance 2.5 Turbo (ByteDance): la mejor relación calidad-precio de Seedance

Seedance 2.5 Turbo usa la misma interfaz de imagen a video que el modelo estándar: fotograma de inicio, fotograma final opcional, de 4 a 30 segundos y audio nativo activado por defecto. Las diferencias son la resolución (solo 720p o 1080p) y el precio: $0.20 por segundo a 720p y $0.22 a 1080p. A 1080p, eso es aproximadamente una cuarta parte de la tarifa estándar.

En la práctica, Turbo es la forma en que la mayoría de la gente debería usar Seedance. Haz un borrador de cada idea en Turbo a 720p y 5 segundos, que cuesta $1.00 por intento. Cuando el movimiento, el ritmo y la conservación de la identidad se vean bien, quédate con el render de Turbo (a menudo basta para redes sociales) o vuelve a ejecutar el prompt ganador en Seedance 2.5 estándar con la duración final.

El flujo de trabajo: borrador y versión final

La iteración es donde se van los presupuestos de imagen a video. Si un plano necesita seis intentos para salir bien, seis borradores de Turbo a 720p y 5 segundos cuestan $6.00. Seis intentos con Seedance 2.5 estándar a 1080p y 10 segundos costarían $54.00. Haz los borradores en barato y renderiza en caro una sola vez.

Mejor para. Anuncios de estilo UGC, clips para redes sociales y cualquier proyecto con volumen. Es el modelo que elegiríamos para un calendario de publicación diaria.

3. Kling 3.0 (Kuaishou): el mejor para planos cortos y dirigidos de personajes

Kling 3.0 tiene dos niveles, Standard y Pro, y en MakeInfluencer.ai genera 3, 5, 10 o 15 segundos a partir de un fotograma de inicio, con fotograma final opcional, en 16:9, 9:16 o 1:1. También acepta un prompt negativo en imagen a video, útil para suprimir artefactos concretos ("dedos extra, temblor de cámara, texto"). El sonido es opcional y se cobra como recargo.

La fortaleza de Kling es el movimiento dirigido y físico de las personas: un giro de cabeza, un movimiento de pelo, una mano que saluda, un paso adelante. Es también la familia que hay detrás de la herramienta específica de control de movimiento, que transfiere el movimiento de un video de referencia a tu imagen fija, y es la herramienta adecuada cuando necesitas un baile o un gesto concreto en lugar de describirlo.

Precio. Standard cuesta $0.084 por segundo sin audio y $0.126 con sonido; Pro, $0.112 sin audio y $0.168 con sonido (verificado el 21 de mayo de 2026). Un clip Standard de 5 segundos cuesta $0.42 sin audio. Eso convierte a Kling 3.0 Standard en la opción más barata de la lista con control de fotograma final, después del nivel de borrador de Gemini Omni y de Wan 3.0 a 480p.

Dónde se queda corto. Quince segundos es el techo, y la capa de sonido es un cargo adicional, no una parte nativa del render. Kling tiende a añadir movimiento expresivo que no pediste, sobre todo en clips más largos, así que sé explícito sobre la contención.

Mejor para. Animación de personajes, clips de moda y belleza, y bucles cortos para redes sociales. La guía de video de Kling 3.0 profundiza en tipos de planos y prompts.

4. Wan 3.0 (Alibaba): el mejor precio por segundo con audio

Wan 3.0 es el líder discreto en relación calidad-precio de esta lista. Genera de 2 a 30 segundos a partir de un fotograma de inicio, con fotograma final opcional, a 480p, 720p o 1080p y con audio nativo activado por defecto. La relación de aspecto puede fijarse en 16:9, 9:16, 1:1, 4:3 o 3:4, o dejar que siga la imagen de entrada.

Precio. $0.05 por segundo a 480p, $0.10 a 720p y $0.20 a 1080p, con audio incluido. Un clip de 10 segundos a 720p con sonido cuesta $1.00. El mismo clip en Seedance 2.5 estándar cuesta $3.60. Wan 3.0 Prime es el mismo modelo en una cola más rápida (aproximadamente la mitad de espera) por $0.075, $0.15 y $0.30 por segundo.

Dónde se queda corto. En planos difíciles, como acción rápida, escenas con mucha gente y primeros planos de manos, se aleja del fotograma de inicio con más facilidad que Seedance 2.5. En planos tranquilos y bien compuestos la diferencia es pequeña; en coreografías complejas se nota.

Mejor para. Clips largos con presupuesto ajustado, material de archivo, giros de producto, fondos para presentadores y cualquier flujo de trabajo en el que necesites muchos clips de 10 a 30 segundos. Por eso es el modelo de video predeterminado del estudio de MakeInfluencer.ai. La guía de video de Wan AI cubre patrones de prompts para la familia Wan.

5. Wan 2.6 Flash (Alibaba): el imagen a video más barato

Wan 2.6 Flash es un nivel exclusivo de imagen a video. Genera de 2 a 15 segundos a 720p o 1080p, con audio generado opcional y entrada de audio opcional para guiar el resultado. No tiene control de fotograma final.

Precio. $0.025 por segundo a 720p sin audio y $0.05 con audio; $0.0375 y $0.075 a 1080p. Un clip de 5 segundos a 720p sin audio cuesta $0.125, aproximadamente una catorceava parte del mismo clip en Seedance 2.5 estándar.

Dónde se queda corto. Es un modelo Flash y se nota en los prompts difíciles: el movimiento es más simple, el detalle fino se suaviza y los clips largos pierden coherencia antes. Es excelente para comprobar si una imagen fija se anima bien y para el movimiento ambiental (pelo con la brisa, vapor de una taza, un travelling lento hacia delante), pero más débil en acciones complejas.

Mejor para. Probar ideas de movimiento a bajo costo, clips ambientales en gran volumen y borradores cortos antes de comprometerte con un render más largo en un modelo premium.

Mejor IA de imagen a video gratis

"Gratis" significa tres cosas distintas en esta categoría, y conviene separarlas.

Gratis sin cuenta. No ofrecemos generación de video gratuita en MakeInfluencer.ai; cada clip del estudio se paga con créditos, y el costo se muestra antes de renderizar. Lo que sí ofrecemos sin cuenta es una vista previa de imagen gratuita en el generador de imágenes con IA, que usa nuestro propio modelo de imagen abierto con un pequeño límite diario por visitante. Sirve para preparar la imagen fija que quieres animar, pero no produce video y no es uno de los modelos de vanguardia comparados aquí. Entre las apps que revisamos, ninguna ofrecía generación recurrente de imagen a video sin cuenta.

Créditos iniciales gratuitos en una app de pago. El plan gratuito de Runway incluye 125 créditos únicos y una selección de modelos (verificado en septiembre de 2026). Pika ofrece un plan de $0 sin créditos mensuales, en el que compras paquetes de créditos según los necesites y los resultados no llevan marca de agua (verificado en septiembre de 2026). La propia app de Kling anuncia créditos gratuitos diarios para usuarios con sesión iniciada; su página indica que el resultado del plan gratuito lleva marca de agua, pero la asignación diaria exacta no figuraba en la página que revisamos, así que confírmala en la app.

Gratis dentro de una suscripción mayor. Google ofrece Veo a través de la app de Gemini y de Flow, con un acceso gratuito y de prueba que varía según el país y el tipo de cuenta. No pudimos confirmar en ninguna página de Google una asignación gratuita estable de Veo 3.1, así que considera provisional cualquier cifra concreta que leas en otro sitio.

Para la mayoría de la gente, la forma más barata y honesta de saber si imagen a video funciona con tu foto es un borrador corto de pago: un clip de 4 segundos a 720p sin audio en Wan 2.6 Flash cuesta $0.10 a precio de lista y te dirá si la cara se mantiene y si el prompt de movimiento se interpreta bien. Si después necesitas audio, clips más largos o 1080p, pasa a Wan 3.0 o a Seedance 2.5 Turbo.

Cuánto cuesta realmente un clip de prueba

Dos clips de borrador de 4 segundos a 720p cuestan $0.20 al precio de lista de Wan 2.6 Flash. Considéralo un banco de pruebas, no un presupuesto de producción: valida la imagen fija y el prompt de movimiento con borradores baratos antes de pagar por más duración y resolución.

6. Veo 3.1 Fast (Google): el mejor clip pulido de 8 segundos con sonido

Veo 3.1 Fast genera 4, 6 u 8 segundos a 720p o 1080p, en 16:9 o 9:16, a partir de un fotograma de inicio con fotograma final opcional. El audio es opcional. La reputación de Veo se basa en el acabado: iluminación limpia, movimientos de cámara convincentes y sonido ambiente y diálogos bien sincronizados. La guía de prompts de Veo 3 cubre los formatos de diálogo.

Precio. $0.10 por segundo sin audio y $0.15 por segundo con audio, en cualquier resolución (verificado el 21 de mayo de 2026). Un clip de 8 segundos a 1080p con audio cuesta $1.20.

Dónde se queda corto. Ocho segundos es el techo, y no hay planos únicos de 30 segundos. No admite formato cuadrado. Veo también tiende a reinterpretar el fotograma de inicio con más libertad que Seedance, lo cual va muy bien para un aspecto cinematográfico y peor cuando la etiqueta de tu producto o la cara de tu personaje deben mantenerse fieles al píxel.

Mejor para. Cortes cinematográficos cortos, líneas de diálogo y ganchos publicitarios donde el sonido importa y 8 segundos bastan.

7. Gemini Omni 1.1 Flash (Google): el mejor nivel de borrador

Gemini Omni 1.1 Flash genera de 3 a 10 segundos a 360p, 720p, 1080p o 4K, en 16:9 o 9:16, con audio sincronizado siempre activado y un fotograma final opcional para la interpolación.

Precio. $0.03 por segundo a 360p, $0.10 a 720p, $0.15 a 1080p y $0.30 a 4K. Un borrador de 5 segundos a 360p cuesta $0.15. Eso lo convierte en la forma más barata de previsualizar un plano con audio.

Dónde se queda corto. Diez segundos es el máximo, el audio no se puede desactivar (así que no puedes ahorrar en B-roll sin sonido) y 360p sirve solo para juzgar el movimiento, no para publicar.

Mejor para. Vistas previas rápidas de movimiento y ritmo antes de comprometerte con un render más caro, y para clips cortos en 4K, donde Seedance 2.5 a 4K costaría seis veces más por segundo.

8. Runway: el mejor editor construido en torno a su propio modelo

Runway vende una suite creativa, no un único modelo. Su página de precios (verificada en septiembre de 2026) enumera Gen-4.5 y Aleph 2.0 como modelos de video propios, y también Seedance 2.0 Pro, Seedance 2.0 Fast y Kling 3.0. Planes: Gratis con 125 créditos únicos y 5 GB de almacenamiento; Standard a $15 por mes ($12 por mes facturado anualmente) con 625 créditos; Pro a $35 por mes ($28 anual) con 2,250 créditos; Max a $95 por mes ($76 anual) con 9,500 créditos.

Fortalezas. Un editor maduro, herramientas de video a video y un flujo de trabajo coherente para los equipos que ya editan en Runway. Si quieres animar una imagen fija y luego editarla, extenderla y componerla sin salir de una sola app, Runway es el paquete más completo de la lista.

Dónde se queda corto. La conversión de créditos a segundos depende del modelo y de los ajustes, así que el costo por clip es más difícil de prever que con precios por segundo de cada modelo. La página de precios mostraba Seedance 2.0 y no 2.5 cuando se verificó.

Mejor para. Editores y estudios pequeños que quieren generación y posproducción en un solo lugar.

9. Luma y Pika: suscripciones multimodelo

Luma (verificado en septiembre de 2026) no tiene plan gratuito en su página de precios. Plus es $30 por mes ($25 anual) con 10,000 créditos, Pro $90 por mes ($75 anual) con 40,000 créditos y Ultra $300 por mes ($250 anual) con 150,000 créditos. Más allá de sus propios modelos Ray3, la página enumera Seedance 2.0 y 2.5, Kling 3.0, Veo 3.1, MiniMax H3 y Gemini Omni Flash. Los modelos propios de Luma siempre han destacado en movimiento atmosférico y cinematográfico.

Pika (verificado en septiembre de 2026) ofrece un plan gratuito sin créditos mensuales (solo paquetes de créditos), Starter a $10 por mes con 900 créditos, Creator a $35 por mes con 3,150 créditos y licencia comercial, y un nivel Fancy desde $95 por mes. Los paquetes de créditos se venden a 60 créditos por dólar. La página incluye Seedance 2.5 y Wan 3.0 entre los modelos disponibles y afirma que los resultados no llevan marca de agua en ningún plan.

Dónde se quedan cortas. Ambas son suscripciones que envuelven una mezcla de modelos. Es cómodo, pero pagas un plan aunque no lo uses y estás un paso alejado del precio por segundo. Comprueba que el modelo y la resolución que quieres estén incluidos en el nivel que elijas; las páginas de precios no detallan los límites de resolución por modelo.

Mejor para. Creadores que quieren una sola factura mensual y una sola interfaz para varias familias de modelos.

10. Hailuo (MiniMax): merece la pena probarlo para movimiento expresivo

Hailuo es la app de video de consumo de MiniMax. Cuando revisamos su página de inicio en septiembre de 2026, destacaba MiniMax H3 y presentaba plantillas de foto a video, como efectos de baile y de video musical. Su página de suscripción no mostraba detalles de planes legibles para nosotros, y los resúmenes de precios de terceros se contradicen entre sí, así que no incluimos precios aquí. Consulta directamente la página de planes antes de presupuestar.

Mejor para. Probar la animación de fotos basada en plantillas y el movimiento humano enérgico. La página de precios de Luma también incluye MiniMax H3, que es otra vía para probarlo.

Otras apps que no clasificamos

Higgsfield es una gran plataforma multimodelo que revende Seedance 2.5, Kling 3.0 y Wan 3.0 junto a su propio modelo DoP de imagen a video, y lanzó una API pública en septiembre de 2026. Sus precios de plan varían según la fuente y no pudimos leerlos en su página de precios el día de la verificación, así que lo tratamos por separado en nuestra guía de alternativas a Higgsfield. Adobe, Canva y CapCut también incluyen funciones de imagen a video dentro de suites de edición más amplias; son razonables si ya pagas por ellas, pero ninguna publica los límites por clip con la claridad suficiente para compararlas aquí.

Cómo escribir prompts de movimiento eficaces para imagen a video

El error más común en imagen a video es escribir un prompt de texto a video. El modelo ya ve la escena. Si vuelves a describir a la mujer, el vestido rojo, el café y la hora dorada, lo invitas a redibujar, y de ahí viene la deriva de identidad. Un prompt de imagen a video debe describir qué cambia, cómo se mueve la cámara y qué debe permanecer igual, en ese orden.

Anatomía de un prompt de movimiento de imagen a video mostrado como tarjetas de índice anotadas junto a un fotograma de inicio impreso

Un buen prompt de movimiento describe el cambio, la cámara y las restricciones, no la escena que el modelo ya ve.

1

Movimiento del sujeto

Una o dos acciones concretas con una velocidad. \'Ella gira la cabeza despacio hacia la cámara y sonríe levemente\' funciona mejor que \'ella se mueve con naturalidad\'.

2

Movimiento secundario

Qué se mueve alrededor del sujeto: el pelo con una brisa ligera, el vapor que sube de la taza, las hojas del fondo, el tráfico que pasa desenfocado.

3

Cámara

Una sola instrucción de cámara: estática, avance lento hacia el sujeto, retroceso lento, cámara en mano con un ligero vaivén, órbita a la izquierda, inclinación hacia arriba. Dos movimientos a la vez suelen producir un movimiento flotante.

4

Restricciones

Qué no debe cambiar: mantener la cara, la ropa y el encuadre sin cambios; conservar la etiqueta legible; evitar que entren personas nuevas en el plano.

Estos son los prompts de movimiento que usamos, agrupados por tipo de trabajo. Están escritos para un fotograma de inicio que ya contiene al sujeto, así que evitan volver a describirlo.

Retrato o creador hablando a cámara (gancho UGC)

Sensación de cámara de móvil en mano, con un vaivén natural sutil. Ella mira al objetivo, levanta ligeramente las cejas y empieza a hablar, gesticulando una vez con la mano derecha. El pelo se mueve un poco. Mantén su cara, su ropa y el fondo sin cambios. Sin zoom.

Producto sobre una mesa (comercio electrónico)

Cámara estática. La botella gira despacio en sentido horario sobre la superficie de mármol, aproximadamente un cuarto de vuelta a lo largo de todo el clip. La luz suave se refleja en el vidrio mientras gira. Mantén la etiqueta nítida y legible y el fondo sin cambios. No dejes que entren manos en el plano.

Plano de estilo de vida con movimiento ambiental

Avance lento hacia el sujeto. El vapor sube de la taza de café, la cortina detrás de ella se mece suavemente con la brisa y ella levanta la taza y da un sorbo. Todo lo demás permanece inmóvil. Mantén su identidad y el encuadre sin cambios.

Paseo de moda

La cámara retrocede al ritmo de sus pasos mientras ella camina hacia la cámara por la acera, con los brazos moviéndose con naturalidad y el bajo del abrigo balanceándose a cada paso. Los peatones del fondo quedan desenfocados. Mantén su cara y su ropa idénticas a las del primer fotograma.

Ritmo de videoclip

Órbita lenta hacia la izquierda alrededor de la cantante. Las luces del escenario pulsan y barren el fondo detrás de ella, la neblina se desplaza entre los haces y ella echa la cabeza hacia atrás al ritmo de la música. Mantén su cara y su vestuario sin cambios. Sin texto ni personas nuevas.

Animación de personaje, bucle de reposo tranquilo

Cámara estática. El personaje respira despacio, parpadea una vez y cambia ligeramente el peso de un pie a otro. El pelo y la tela se mueven con suavidad. Termina en la misma pose que el primer fotograma. Mantén el estilo y las proporciones sin cambios.

Para el bucle de reposo, usa de nuevo la imagen de inicio como fotograma final en cualquier modelo que lo admita (Seedance 2.5, Kling 3.0, Wan 3.0, Veo 3.1 Fast, Gemini Omni 1.1 Flash). Así el bucle se cierra limpiamente, y es mucho más fiable que pedir con palabras un bucle perfecto.

Las palabras de velocidad pesan más que los adjetivos

"Despacio", "aproximadamente un cuarto de vuelta", "una vez" y "al ritmo de sus pasos" hacen más trabajo que "cinematográfico", "impresionante" o "hermoso". Los modelos de imagen a video tienden a pasarse de movimiento; las palabras de cantidad son las que mantienen el movimiento proporcionado a la duración del clip.

Deja que el fotograma de inicio haga el trabajo

El fotograma de inicio decide más del resultado que el prompt. Estas son las reglas que aplicamos antes de animar cualquier imagen fija:

  • Usa la relación de aspecto final. Recorta a 9:16 antes de animar un clip vertical. Si dejas que el modelo extienda el área que falta, inventa contenido en los bordes, y el contenido inventado deriva.
  • Deja espacio para el movimiento. Si el sujeto va a levantar una mano, esa mano necesita un sitio adonde ir. Un encuadre muy cerrado en la cabeza que debe "saludar" se cortará o hará aparecer una mano de la nada.
  • Muestra las manos con claridad o no las muestres. Las manos a medio ocultar son la fuente más común de deformaciones. Encuádralas completas y relajadas, o déjalas fuera del encuadre.
  • Prefiere una luz suave y direccional. La luz dura del mediodía y las temperaturas de color mezcladas parpadean más cuando el modelo vuelve a iluminar una cara en movimiento.
  • Reduce el texto al mínimo. Las etiquetas y los carteles sobreviven mejor al movimiento cuando son grandes, están de frente a la cámara y son pocos.

Si generas tus imágenes fijas, GPT Image 2.5 es nuestra opción por defecto para fotogramas de inicio fotorrealistas porque sigue muy de cerca las instrucciones de encuadre; la guía de consistencia de personaje explica cómo mantener a la misma persona en un conjunto de imágenes fijas antes de animarlas, y el flujo de trabajo de storyboard a película muestra cómo planificar una secuencia de fotogramas de inicio y final para una pieza de varios planos.

Cómo elegir la IA de imagen a video según el caso de uso

Los rankings solo llegan hasta cierto punto. El modelo adecuado depende de para qué sea el clip. Estas son las opciones que elegiríamos para los cuatro trabajos por los que más nos preguntan.

Anuncios UGC

Elige: Seedance 2.5 Turbo a 720p, 9:16, 5 a 10 segundos, audio activado para borradores.

Los anuncios UGC necesitan una persona creíble, un gancho en los dos primeros segundos y volumen: probarás muchas variantes del mismo concepto. Con los $0.20 por segundo de Turbo a 720p, una variante de 10 segundos cuesta $2.00 y mantiene bien la cara para verla en el móvil. Si el anuncio tiene una línea hablada, genera lo visual con imagen a video y añade la voz con la herramienta de sincronización labial para controlar el guion exacto. La guía de anuncios UGC con IA cubre ganchos, guiones y divulgación, y el generador de anuncios con IA es un punto de partida sin registro para anuncios estáticos.

Alternativa económica: Wan 3.0 a 720p, $1.00 por 10 segundos con audio.

Planos de producto

Elige: Wan 3.0 o Seedance 2.5 Turbo con fotograma de inicio y fin.

Los clips de producto se ganan o se pierden en la etiqueta. Usa una cámara estática o una órbita lenta, una rotación de un cuarto de vuelta y un fotograma final que muestre el producto desde el ángulo de cierre, para que el modelo interpole en lugar de inventarse la parte trasera del envase. Mantén los clips en 4-6 segundos; las rotaciones más largas dan al modelo más oportunidades de redibujar el texto. Para ubicaciones principales en una landing page, vuelve a ejecutar el prompt ganador en Seedance 2.5 estándar a 1080p.

Animación de personaje

Elige: Kling 3.0 para acciones cortas y dirigidas; Seedance 2.5 para planos largos.

Con un personaje de IA coherente, conservar la identidad lo es todo. Kling 3.0 rinde bien en una sola acción deliberada de 5 a 10 segundos, y su prompt negativo ayuda a suprimir artefactos recurrentes. En planos de 15 a 30 segundos, Seedance 2.5 mantiene la cara con más fiabilidad. Si necesitas un movimiento coreografiado concreto, usa el control de movimiento con un video de referencia en lugar de describirlo. La guía para crear un influencer de IA a partir de una foto explica cómo construir el personaje en sí.

Videoclip

Elige: Seedance 2.5 o Wan 3.0 para planos de 15 a 30 segundos sin audio, y luego corta sobre tu pista.

Trata cualquier audio nativo de un plano de videoclip como prescindible: lo sustituirás por la canción, así que desactiva el audio donde el modelo lo permita y no le hagas caso al juzgar los planos. Planifica la pieza como una serie de fotogramas de inicio, genera cada plano con la duración de una frase musical y corta al ritmo en tu editor. Con los $0.10 por segundo de Wan 3.0 a 720p, un videoclip de 20 planos de 10 segundos cada uno cuesta $20 en generación, antes de repeticiones. Nuestra página del generador de videos musicales con IA está construida en torno a este flujo de trabajo.

Feature
Seedance 2.5 Turbo
Seedance 2.5
Para borradores y la mayoría del contenido para redes sociales, Turbo ofrece el mismo rango de 4 a 30 segundos y audio nativo por $0.20 por segundo a 720p frente a $0.36. Seedance 2.5 estándar mantiene la ventaja en salidas de 480p y 4K y en planos principales donde se inspecciona cada fotograma.
Feature
Wan 3.0
Veo 3.1 Fast
Para cualquier cosa de más de 8 segundos, Wan 3.0 gana por defecto: de 2 a 30 segundos con audio nativo a $0.10 por segundo a 720p. Veo 3.1 Fast mantiene la ventaja en clips cortos y cinematográficos con diálogo.
Feature
Kling 3.0
Wan 2.6 Flash
Ambos son baratos. Kling 3.0 Standard cuesta más ($0.084 frente a $0.025 por segundo sin audio), pero añade control de fotograma final, prompt negativo y un movimiento claramente mejor en personas. Wan 2.6 Flash gana en clips ambientales en masa y en pruebas económicas.

Fallos comunes y cómo solucionarlos

Todos los modelos de esta lista fallan de las mismas maneras, y son manejables. Saber cuál es el fallo te dice qué palanca tocar.

Hoja de contacto de fotogramas de video con marcas de lápiz de grasa circundando una mano deformada y una cara a la deriva

Marca el primer fotograma en el que el clip se rompe; ese fotograma te dice si debes cambiar el prompt, la imagen de inicio o la duración.

Deriva de identidad

Síntoma. La cara del último segundo es la de una persona ligeramente distinta a la del primer fotograma. La mandíbula, la forma de los ojos o la línea del pelo se van desplazando poco a poco, a menudo tras un giro de cabeza.

Soluciones.

  1. Elimina del prompt las palabras de apariencia. Describir a la persona invita al modelo a redibujarla.
  2. Añade una restricción explícita: "Mantén su cara idéntica a la del primer fotograma".
  3. Acorta el clip. La deriva se acumula con el tiempo; dos clips de 8 segundos unidos en edición suelen superar a un clip de 16 segundos.
  4. Aporta un fotograma final de la misma persona. Con ambos extremos fijados, el modelo tiene mucho menos margen para desviarse.
  5. Reduce el giro de cabeza. Un giro de más de unos 45 grados obliga al modelo a inventar el lado que no se ve de la cara.
  6. Sube de nivel. En planos difíciles, Seedance 2.5 mantiene la identidad mejor que los modelos económicos.

Manos y objetos deformados

Síntoma. Los dedos se funden, se multiplican o se doblan de forma imposible; una taza se derrite en la mano; las joyas cambian de forma.

Soluciones.

  1. Corrige primero el fotograma de inicio. Las manos parcialmente ocultas, superpuestas o en el borde del encuadre son la causa habitual.
  2. Dale a las manos una tarea sencilla: "levanta la taza y da un sorbo", no "gesticula mientras habla y se arregla el pelo".
  3. En Kling 3.0, añade un prompt negativo: "dedos extra, dedos fusionados, manos deformadas".
  4. Ralentiza la acción. El movimiento rápido de las manos es donde empiezan el desenfoque de movimiento y la deformación.
  5. Deja las manos fuera del fotograma de inicio si no tienen por qué aparecer en el plano.

Exceso de movimiento

Síntoma. Todo se mueve a la vez: la cámara sale disparada, el sujeto baila cuando solo pediste una sonrisa, el fondo ondula. El clip parece una demo de IA y no metraje real.

Soluciones.

  1. Usa una sola instrucción de cámara, o "cámara estática".
  2. Añade cantidades: "despacio", "una vez", "ligeramente", "un cuarto de vuelta".
  3. Indica qué permanece quieto: "todo lo demás permanece inmóvil".
  4. Ajusta la duración a la acción. Una sola sonrisa no necesita 10 segundos; el modelo rellena el tiempo sobrante con movimiento extra. Usa de 4 a 5 segundos.
  5. Desactiva la expansión de prompt donde exista. En MakeInfluencer.ai viene desactivada por defecto en Wan 3.0 para que tu prompt no se reescriba en algo más recargado.

Resultado congelado o casi estático

Síntoma. El problema opuesto: el clip es una imagen fija con un ligero zoom.

Soluciones. Da un verbo de acción concreto y una fuente de movimiento secundario ("el vapor sube", "el pelo se mueve con el viento"). Evita los prompts que solo contengan restricciones. Si un modelo congela siempre una imagen concreta, prueba otro; algunas imágenes fijas (gráficos planos, recortes muy cerrados) simplemente no le dan al modelo nada que mover.

Etiquetas y texto dañados

Síntoma. La etiqueta de un producto se desenfoca, las letras se intercambian y los logos se emborronan durante la rotación.

Soluciones. Mantén la rotación pequeña, deja la etiqueta de cara a la cámara en los fotogramas de inicio y final, usa clips de 4 a 6 segundos y renderiza la versión final a 1080p. Si un clip es perfecto salvo por una etiqueta que tiembla, suele ser más rápido superponer la etiqueta original en la edición que volver a generar.

Audio que no encaja

Síntoma. El audio nativo añade música, ruido de multitud o diálogos que no querías.

Soluciones. Describe en el prompt el sonido que quieres ("sala silenciosa, una taza que se deja sobre la mesa") o desactiva el audio en los modelos que lo permiten (Seedance 2.5, Wan 3.0, Wan 2.6 Flash, Kling 3.0, Veo 3.1 Fast) y añade el sonido en la edición. Gemini Omni 1.1 Flash siempre genera audio.

Haz una prueba de una tarde antes de comprometerte

Los rankings son un punto de partida. Tus imágenes fijas, tu sujeto y tu plataforma deciden al ganador. Esta prueba lleva unas dos horas y unos pocos dólares.

  1. Elige tres imágenes fijas que representen tu trabajo real: una persona, un producto y una escena amplia. Recorta cada una a la relación de aspecto con la que publicarás.
  2. Escribe un prompt de movimiento por imagen con la estructura de cuatro partes de arriba.
  3. Pasa cada imagen por tres modelos a 720p y 5 segundos: uno económico (Wan 2.6 Flash o Wan 3.0), uno intermedio (Seedance 2.5 Turbo o Kling 3.0 Standard) y uno premium (Seedance 2.5 o Veo 3.1 Fast). Ejecuta primero el nivel económico en el estudio de imagen a video; es la forma más barata de comparar el movimiento.
  4. Puntúa cada clip con tres criterios: conservación de la identidad (¿coincide el último fotograma con el primero?), calidad del movimiento (manos, tela, cámara) y utilidad (¿lo publicarías?).
  5. Divide el costo entre el número de clips utilizables. Un modelo que cuesta el doble pero es utilizable el doble de veces sale igual por clip publicable.
  6. Vuelve a ejecutar el mejor prompt una vez más en el modelo ganador. La consistencia entre ejecuciones importa más que un render con suerte.

En MakeInfluencer.ai toda la prueba se hace en un solo lugar: el generador de video con IA ofrece todos los modelos de esta guía, muestra el costo en créditos antes de cada render y guarda tus prompts en el historial. Los desarrolladores pueden hacer la misma comparación con la API, donde cada modelo es una solicitud POST; la guía de la API de imagen a video para influencers lo explica paso a paso.

Preguntas frecuentes

¿Cuál es la mejor IA de imagen a video en 2026?

Para calidad general y control, Seedance 2.5 de ByteDance: de 4 a 30 segundos, hasta 4K, audio nativo y fotogramas de inicio y final. Para la mayor parte del trabajo diario, Seedance 2.5 Turbo da resultados similares a 720p o 1080p por $0.20 a $0.22 por segundo. Para el mejor precio por segundo con audio, Wan 3.0 de Alibaba, a $0.10 por segundo a 720p.

¿Cuál es la mejor IA de imagen a video gratis?

MakeInfluencer.ai no ofrece video gratuito; su estudio funciona con créditos, y el borrador más barato es Wan 2.6 Flash de Alibaba, a $0.025 por segundo a 720p sin audio. Puedes preparar el fotograma de inicio gratis con nuestro generador de imágenes con IA, que no requiere cuenta. Entre las apps, el plan gratuito de Runway incluye 125 créditos únicos y la app de Kling ofrece créditos diarios gratuitos con marca de agua en el resultado (ambos verificados en septiembre de 2026).

¿Puedo animar una foto de una persona real?

Técnicamente sí, y la mayoría de las herramientas lo permiten. Si deberías hacerlo depende del consentimiento y de las reglas de la plataforma. Anima únicamente fotos de personas que hayan dado su consentimiento, nunca presentes como auténtico un metraje sintético de una persona real y sigue las reglas de divulgación de la plataforma donde publiques. Nuestro estudio también modera las imágenes que subes y rechaza las que no puede animar.

¿Qué IA de imagen a video mantiene mejor la coherencia de la cara?

Seedance 2.5 suele conservar mejor la identidad en clips largos, seguido de Kling 3.0 en planos cortos y dirigidos. Sea cual sea el modelo, la identidad se conserva mejor cuando dejas de describir a la persona en el prompt, mantienes los clips cortos y fijas un fotograma final.

¿Cuánto puede durar un clip de imagen a video?

Seedance 2.5, Seedance 2.5 Turbo y Wan 3.0 llegan a 30 segundos en una generación. Kling 3.0 y Wan 2.6 Flash llegan a 15 segundos, Gemini Omni 1.1 Flash a 10 y Veo 3.1 Fast a 8. Seedance 2.5 Video Extend puede prolongar un clip más allá de una sola generación.

¿Cuánto cuesta la IA de imagen a video?

A precios de lista del proveedor, un clip de 5 segundos a 720p va desde $0.125 (Wan 2.6 Flash, sin audio), pasando por $0.42 (Kling 3.0 Standard, sin audio), $0.50 (Wan 3.0 con audio) y $1.00 (Seedance 2.5 Turbo), hasta $1.80 (Seedance 2.5). La tabla completa está en la guía de precios de modelos de video con IA.

¿Sigue siendo Sora 2 una opción para imagen a video?

No. OpenAI retiró la API de Sora Videos el 24 de septiembre de 2026. Usa Seedance 2.5, Veo 3.1 Fast o Wan 3.0 en su lugar.

¿Cuál es la diferencia entre imagen a video y texto a video?

Texto a video inventa toda la escena a partir de palabras. Imagen a video parte de tu imagen, así que controlas exactamente el sujeto, la composición y la iluminación, y el modelo solo añade movimiento. Por eso imagen a video es el flujo de trabajo estándar para personajes y productos coherentes: fija el aspecto en una imagen y luego anímala.

¿Necesito un fotograma final?

No, pero es el control más fiable que tienes. Un fotograma final convierte la generación en una interpolación entre dos imágenes conocidas, lo que reduce la deriva, frena el exceso de movimiento y hace posibles los bucles. Seedance 2.5, Kling 3.0, Wan 3.0, Veo 3.1 Fast y Gemini Omni 1.1 Flash lo aceptan; Wan 2.6 Flash no.

¿Qué relación de aspecto debo usar?

Usa la relación con la que vayas a publicar y recorta a ella el fotograma de inicio antes de animar: 9:16 para TikTok, Reels y Shorts, 16:9 para YouTube y web, 1:1 para feeds. Veo 3.1 Fast y Gemini Omni 1.1 Flash solo ofrecen 16:9 y 9:16.

Conclusión

Para la mayoría de la gente, la mejor IA de imagen a video en 2026 no es un modelo, sino un hábito de dos pasos: prueba barato y renderiza una sola vez en el modelo que encaje con el plano. Prepara la imagen fija con el generador de imágenes con IA gratuito, comprueba que se anima con un clip barato de Wan 2.6 Flash en el estudio de imagen a video, haz un borrador en Seedance 2.5 Turbo o Wan 3.0 y reserva Seedance 2.5 estándar o Veo 3.1 Fast para los clips que sostienen la pieza. Los planes actuales están en la página de precios, y la tarifa por segundo de cada modelo, en la guía de precios. Si tienes preguntas sobre un flujo de trabajo concreto, escribe a [email protected].

Las capacidades de los modelos y los precios de lista del proveedor se leyeron en el registro de modelos de MakeInfluencer.ai y en el manifiesto de precios el 29 de septiembre de 2026 (los precios de Kling 3.0 y Veo 3.1 Fast se verificaron por última vez el 21 de mayo de 2026). Los planes de Runway, Luma y Pika se leyeron en la página de precios pública de cada proveedor y están marcados como verificados en septiembre de 2026. Las cifras de la app de Kling, Hailuo y Google que no se pudieron confirmar en la página del proveedor se indican como no confirmadas. Esta guía no está afiliada a ByteDance, Kuaishou, Alibaba, Google, Runway, Luma AI, Pika ni MiniMax.

¿Listo para probarlo tú mismo?

Comienza a crear influencers de IA y generar contenido en minutos.