Cómo hicimos VLA Webrunner: guía completa de producción de video con IA



VLA AI Content Machine · Teardown de producción

Cómo hicimos VLA Webrunner sin cámara, sin estudio y sin actor

Un comercial vertical de 39 segundos: un hombre real en su escritorio, un traje que se forma sobre su cuerpo, un salto por la ventana y una travesía por Manhattan colgado de un filamento. Todo generado con IA. Acá está el método completo, con los prompts literales que se le mandaron al motor.

Duración
38,8 s
Formato
9:16
Motor de video
Seedance 2.0
Clips generados
9
Costo por clip
~$0,75

Escritorio, antes de la transformaciónEl traje ya formado sobre el cuerpoEl salto por la ventanaSwing sobre la avenidaCierre hablando a cámara
Ver el comercial completo se abre en una pestaña nueva · 18 MB

Cinco fotogramas del corte final, en orden. Ninguno es un montaje: son frames reales del video que vas a ver.
LA IDEA CENTRAL

Menos cortes gana

Si te llevás una sola cosa de esta guía, que sea ésta.

El instinto natural es escribir un guion de ocho escenas y pedirle al motor una escena a la vez. Es exactamente lo que hicimos primero, y es la razón por la que la primera versión salió mal: cada corte le cuesta identidad al personaje. Cuando encadenás la escena 2 usando la escena 1 como referencia, y la 3 usando la 2, la cara va derivando de a poco. En la quinta escena ya no es la misma persona — y el error es invisible mientras revisás clip por clip, porque cada uno se parece al anterior.

La solución tiene dos mitades, y las dos importan:

  1. Un clip continuo con timeline interno le gana a varios clips encadenados. En vez de pedir cinco escenas de 3 segundos, se pide una toma de 15 segundos y dentro del prompt se escribe la coreografía por tramos («0-2s… 2-4s… 4-6s»). El motor mantiene la continuidad porque nunca sale del plano.
  2. Las referencias de identidad se reinyectan en cada generación, no solo en la primera. Aunque una escena venga después de otra, el prompt vuelve a mandar las mismas fotos de referencia. Esto es lo que corta la deriva.
De dónde sale esto

No es teoría. La primera versión del comercial encadenó seis escenas usando solo el video previo como referencia, y en las escenas 5 y 6 la cara ya era de otra persona. La segunda versión reinyectó las referencias verificadas en las seis escenas y el problema desapareció. Es el mismo diagnóstico que se lee en los prompts que publican los creadores del trend: todos empujan la identidad en cada tramo, no una vez al principio.

PASO 1

El personaje no es una foto: es una biblia

Acá está el error que casi todo el mundo comete. Subís una selfie, escribís «hazme un superhéroe» y el motor te devuelve un superhéroe distinto cada vez: otro traje, otro emblema, otro tono de piel. No porque falle — porque nunca le dijiste qué cosa es constante.

Un personaje reproducible necesita una biblia canónica: un documento que fija identidad, cuerpo, vestuario con códigos de color exactos, reglas de continuidad y una lista de negativos. Después, cada generación cita esa biblia. Ésta es la nuestra:

Hoja de personaje de VLA Webrunner: vistas canónicas, rostro de referencia, detalle del traje, física del movimiento y paleta
La hoja de personaje completa. Cada recuadro existe por una razón: las vistas fijan la silueta, el rostro fija la identidad, el detalle del traje fija los elementos que el motor tiende a inventar, y la fila de física fija cómo se mueve.

Las cinco vistas canónicas

De la foto ancla se generan cinco vistas por image-to-image, todas con el mismo vestuario y sobre fondo de estudio gris. Estas cinco imágenes son las que después viajan como referencia a cada video.

Frontal
Frontal
Tres cuartos
Tres cuartos
Perfil
Perfil
Espalda
Espalda
Acción
Acción

Este es el prompt literal que genera cada vista. Lo único que cambia entre las cinco es la línea de la pose:

i2i · vista canónicaSeedream 5 Pro · 1728×2304
Character turnaround sheet of an ORIGINAL character (not derived from any existing franchise). Use the uploaded image as the ONLY face reference: preserve the person's face exactly — same features, beard, hairstyle, skin tone, age and body proportions. Absolutely no face drift, no beautification, no stylization. {POSE}. OUTFIT: {TRAJE_DE_LA_BIBLIA}. Seamless neutral grey studio background, soft even studio lighting, full body head to feet, photorealistic. No text, no watermark, no logos drawn by the model.

Las cinco poses, textuales:

las 5 poses
frontal      → front-facing full-body view, neutral confident standing pose, arms relaxed at sides
tresCuartos  → three-quarter full-body view turned to the right, relaxed confident stance
perfil       → full right side profile view, standing straight, arms relaxed
espalda      → full back view, standing straight, showing the back of the outfit
accion       → low athletic ready crouch, knees bent, one hand touching the floor, head up looking forward

El detalle que nadie te cuenta: fondo gris de estudio

No es una decisión estética. Seedance rechaza las imágenes que parecen una fotografía de una persona real, con el error InputImageSensitiveContentDetected.PrivacyInformation. Probamos con la foto original, con la misma foto servida desde otro dominio y con recortes: todas rechazadas. Las vistas generadas sobre fondo de estudio gris pasan, porque el filtro las lee como render y no como captura de una persona.

El traje, palabra por palabra

Esta es la parte del vestuario que se copia idéntica en cada generación. Fijate el nivel de especificidad: hexadecimales, centímetros, milímetros, cantidad de nodos del emblema. Cada número que no escribís es un número que el motor va a inventar distinto cada vez.

vestuario canónicofragmento de la biblia
Original VLA technical suit designed for urban traversal and impact mitigation. Base color deep navy blue (#0F2A44) in matte nano-weave with subtle ripstop texture; vivid orange (#e9511d) accents as thin edge piping and segmented reinforcement bands. Panel layout: geometric data-network patterns (printed and lightly embossed) combining circuit traces, topographic contour lines, and network-node dots; patterns are asymmetrical and map-like (never radial webs). Seams: bonded seams with visible micro-stitching only at stress points (shoulders, hips, inner thighs). Chest emblem: proprietary VLA kinetic-network emblem—an abstract triangular node-cluster forming a forward-leaning chevron made of 7 connected dots and 6 thin links, centered on sternum, 11 cm tall, orange on navy with a thin reflective graphite outline. Utility: wrist-mounted AI kinetic filament launchers integrated into forearm bracers (graphite composite with orange status strip, small circular emitter port 18 mm diameter at inner wrist). Filament: translucent smoky-gray kinetic line with faint orange pulse segments traveling along it during tension changes; thickness 2–4 mm depending on load. Belt: low-profile modular belt in graphite with orange latch, no external pouches swinging. Footwear: integrated boots with segmented sole and orange heel stabilizer; toe is navy matte, no bright franchise toe caps.

Y la lista de negativos, que es igual de importante

Un personaje original necesita defenderse activamente de los parecidos. Estos negativos existen porque el motor, si no le decís nada, deriva hacia lo que ya conoce — y ahí es donde te rechazan la generación por copyright.

negativos
spider symbol, spider logo, spider silhouette, arachnid emblem
web pattern fabric, web-mesh suit texture, radial webbing graphics
red and blue superhero suit, classic comic spandex look
large white eye lenses, bug-eye mask, full face covered mask that hides identity
iconic franchise poses, wall-crawling like an arachnid, sticky finger climbing
magic powers, biological webbing, wrist web shooters with classic design cues
cape, bat-like shapes, lightning bolt emblems, star shields, recognizable superhero insignias
cartoon/anime proportions, over-smooth plastic skin, heavy beauty filter
blood, gore, excessive brutality
copyrighted logos, brand names other than VLA

Lección de copyright, aprendida a los golpes

Las primeras generaciones fueron rechazadas por el motor. El detonante no era solo el texto: el emblema y la pose de columpio ya disparaban el filtro visualmente. Cambiar el nombre no alcanza. Lo que funcionó fue rediseñar el personaje de verdad: filamento cinético en lugar de telaraña, emblema de nodos en lugar de araña, paleta azul marino y naranja en lugar de rojo y azul. Un personaje original pasa; un homenaje disfrazado, no.

PASO 2

Si la cara es de una persona real, hay un trámite

Esta parte no se resuelve con prompting. Para que un motor de video acepte generar la cara de una persona real, esa persona tiene que estar registrada y verificada en la biblioteca de assets del proveedor. En BytePlus se hace desde la consola: My assets → Real-human, con una verificación por QR donde la persona graba el gesto que le piden.

Una vez verificada, la referencia se manda con un identificador propio en lugar de una URL:

referencia verificada
asset://asset-20260705100457-l5pgx

Nosotros mandamos tres assets verificados de la misma persona (distintos ángulos) en cada llamada. Y un hallazgo útil que no está en la documentación: asset:// también funciona como first_frame, no solo como referencia.

Regla honesta

Sin este paso, cualquier imagen con una cara realista servida por URL pública te va a devolver el error de privacidad. Las únicas cosas que pasan el filtro son: los assets verificados, las imágenes que no parecen fotografía de una persona, y los videos que el propio motor generó antes. No hay atajo, y no deberías buscarlo: es el mecanismo que impide que alguien genere videos con la cara de otra persona.

PASO 3

La anatomía del prompt: cinco bloques que se repiten siempre

Acá está el corazón del método. Cada prompt de escena es la misma estructura: cinco bloques de bloqueo idénticos en todas las escenas, y al final el único bloque que cambia, que es la acción. Los bloques fijos son largos y redundantes a propósito — la redundancia es lo que compra consistencia.

Bloque 1 — Identidad

Primero y en mayúsculas, porque establece la prioridad: si la acción entra en conflicto con la identidad, gana la identidad.

LOCK · identidad
IDENTITY IS THE TOP PRIORITY: the face must be EXACTLY the man in the reference photos in every single frame — same facial structure, same eyes, same nose, same beard shape and density, same hairline, same skin tone, same age. If any conflict arises between action and identity, preserve identity. He wears the same navy-blue technical suit with fine orange piping, circuit-network pattern and the full-color VLA logo centered on the chest. No mask, no cape.

Más adelante endurecimos este bloque con una frase que cambió los resultados de forma visible:

LOCK · versión endurecidala que usamos en las escenas nuevas
Use the uploaded person as the sole identity reference. The main character throughout the entire video must be exactly the uploaded person. Preserve the exact facial features, facial proportions, hairstyle, beard, skin tone, body shape and age in every frame. Absolutely no face drift, no identity change, no beautification, no stylization, no anatomy distortion, no replacement.

Por qué «no beautification» importa tanto

El motor tiende a mejorarte: te alisa la piel, te simetriza la cara, te afina la nariz. El resultado no es fea la imagen — es que ya no sos vos, es un actor genérico guapo. Prohibir la embellecedura explícitamente es lo que devuelve los poros, las asimetrías y la barba con pelos individuales. Sin esa frase, la cara se te escapa aunque todo lo demás esté bien escrito.

Bloque 2 — El objeto que el motor siempre malinterpreta

En nuestro caso el cable. En el tuyo será otra cosa: el arma, el vehículo, el producto. Identificá el objeto que el motor dibuja mal y dedicale un bloque entero, en negativo y en positivo.

CABLE · el objeto crítico
The kinetic filament is a THIN SILVER-WHITE metallic cable. It is NOT red and NOT a spider web. The only orange is a small glow at the wrist emitter.

Este bloque nació de una corrección concreta: en la primera versión el filamento salía rojo, porque el motor lo asociaba con otra referencia. Decirle «plateado» no alcanzaba; hubo que decirle además «no es rojo y no es una telaraña».

Bloque 3 — Dirección del tiempo

Los motores de video, cuando dudan, generan movimiento reversible: alguien que aterriza y despega hacia atrás, un salto que se deshace. Se arregla con una línea.

DIR · dirección
DIRECTION LOCK: he always moves FORWARD and LEFT TO RIGHT. Time moves forward. Nothing ever moves backward or in reverse.

Bloque 4 — La capa de vida

La diferencia más grande entre un video que parece IA y uno que parece real no es la resolución: es que la cara esté viva. Hay que pedirlo explícitamente, micro-gesto por micro-gesto.

LIFE · capa de vida
LIFE LAYER: hair moves with the wind and settles, eyebrows react to effort, irregular natural blinking, visible breathing, subtle jaw tension, a brief genuine smile at the fastest moment. Never a frozen or mannequin face.

Fijate en «irregular natural blinking». Si solo pedís que parpadee, parpadea con métrica de reloj y se nota. La irregularidad es la que lee como humana.

Bloque 5 — El mundo y la física

Acá se define el lugar, la luz, y sobre todo la ley física que no se puede violar. «La gravedad actúa de forma continua; él nunca vuela» es la frase que evita el efecto flotante.

WORLD · mundo y física
Realistic Manhattan avenue, late afternoon, dry street, warm sunlight from camera-left, yellow taxis, pedestrians, brick and limestone facades. Gravity acts continuously; he never flies. Photorealistic premium live-action commercial, one continuous camera move, no cuts.

Y así se arma el prompt final

Los cinco bloques se concatenan con línea en blanco entre cada uno, la acción va al final precedida por SHOT:, y los parámetros se pegan al final de la cadena de texto:

ensambladoasí queda cada prompt de escena
[LOCK]

[CABLE]

[DIR]

[LIFE]

[WORLD]

SHOT: [la acción de esta escena]  --ratio 9:16 --resolution 720p --duration 4

PASO 4

Los nueve prompts, escena por escena

Estos son los textos exactos. En las seis escenas de acción, lo que ves es el bloque SHOT: — los cinco bloques de bloqueo del paso anterior van adelante, iguales en todas. En las tres escenas nuevas (intro, transición y cierre) el prompt es completo, con timeline interno.

Un detalle de escritura que vale más que cualquier truco: fijate cómo cada acción describe biomecánica, no adjetivos. No dice «aterriza elegantemente»; dice «los antepiés hacen contacto primero, tobillos, rodillas y caderas flexionan para absorber, una mano toca el techo». El motor no sabe qué es elegante. Sí sabe qué es un antepié.

Frame del reveal en el escritorio

Intro · el reveal en el escritorio

Persona común en su oficina, mira a cámara, y el traje se forma sobre su cuerpo. Prompt completo con timeline interno.

6 s · prompt completo

INTRO_reveal
Use the uploaded person as the sole identity reference. The main character throughout the entire video must be exactly the uploaded person. Preserve the exact facial features, facial proportions, hairstyle, beard, skin tone, body shape and age in every frame. Absolutely no face drift, no identity change, no beautification, no stylization, no anatomy distortion, no replacement.

TIMELINE:
0-2s: He sits at a modern desk in a warm, lived-in home office at golden hour, wearing an ordinary dark t-shirt, working at a laptop. Soft orange light comes through a window behind him with the Manhattan skyline out of focus. He is relaxed and real. Medium shot, eye level, camera slowly pushing in.
2-4s: He stops typing, lifts his eyes and looks directly into the lens with a calm confident half-smile. He breathes, blinks naturally, hair slightly moved by the air.
4-6s: A wave of fine orange light travels up his body and the ordinary t-shirt transforms into the navy-blue technical suit with fine orange piping, circuit-network pattern and the full-color VLA logo centered on the chest. The transformation is smooth and physical, following the shape of his body, like fabric materialising, not a cartoon effect. He straightens his shoulders. The camera holds on him.

Photorealistic premium live-action commercial, cinematic golden hour lighting, natural skin texture, one continuous camera move, no internal cuts, no text on screen. Audio: quiet room tone, keyboard, a low rising synth swell as the suit forms. --ratio 9:16 --resolution 720p --duration 6

Frame del salto por la ventana

Transición · ventana → azotea

El puente que faltaba entre el escritorio y la acción. Termina exactamente en la postura con la que arranca la escena siguiente: corriendo hacia el borde.

8 s · prompt completo

TRANSICION_ventana_azotea
Use the uploaded person as the sole identity reference. Preserve the exact facial features, facial proportions, hairstyle, beard, skin tone, body shape and age in every frame. Absolutely no face drift, no identity change, no beautification, no stylization, no anatomy distortion. He wears the navy-blue technical suit with fine orange piping, circuit-network pattern and the full-color VLA logo centered on the chest. No mask, no cape.

TIMELINE:
0-1.5s: Interior of a warm home office at golden hour. He stands at a large open window with the Manhattan skyline behind him, one hand on the frame, looking out and down at the city. Camera behind and slightly to his right.
1.5-3s: He steps up onto the windowsill and pushes off, launching himself out of the window into open air with real weight and intention — a deliberate jump, not a fall. The camera follows him out through the window in one continuous move.
3-5s: He drops through the air between buildings, body angled forward, arms out for balance, legs trailing, hair and fabric pushed by the rushing air. The street is far below. Warm golden light on his left side.
5-7s: He lands on a lower rooftop in a controlled crouch — both forefeet contact first, ankles, knees and hips flex deeply to absorb the impact, one hand touches the roof surface, the torso leans forward. Real weight and impact.
7-8s: Without pausing he rises out of the crouch and starts running forward across the rooftop toward the far edge, camera settling behind him. He is mid-stride when the shot ends.

He never flies or hovers; gravity acts continuously. He always moves FORWARD; nothing moves backward or in reverse. His face stays alive: eyes narrowing against the wind, hair pushed back, jaw set, a flicker of exhilaration. Photorealistic premium live-action commercial, one continuous camera move, no internal cuts, motion blur proportional to speed. Audio: room tone, the rush of air on the jump, wind rising, the impact of the landing on the roof, footsteps starting to run. --ratio 9:16 --resolution 720p --duration 8

Keyframe: azotea antes del salto

Escena 1 · salto y primer filamento

Se levanta de la cuclilla, dos pasos, salta al vacío, dispara el cable y empieza el arco de péndulo.

4 s · va después de los 5 bloques

SHOT · 01_jump_launch
He rises from a crouch at the rooftop edge, takes two quick running steps forward, plants his left foot at the parapet and LEAPS FORWARD into open air over the avenue with real weight. Brief free fall, legs trailing from inertia, eyes on a metal bracket high on the building ahead-right. He extends his right arm and the silver cable launches from his wrist and connects; the cable goes taut, his hand closes, the shoulder rises, and he begins a pendulum arc rightward. Low-angle camera near street level tilting smoothly upward. Audio: city traffic, rooftop footfalls, wrist launcher, cable tension, rising wind.

Keyframe: descenso en el swing

Escena 2 · swing sobre la avenida

Baja al cañón de la avenida, la velocidad hace pico sobre los taxis, sube del otro lado y suelta el cable en la tangente.

5 s

SHOT · 02_swing_city
Same man, same suit, same face as the reference photos. He descends into the avenue canyon on the taut silver cable, right arm extended overhead, legs trailing, left arm open. Speed peaks a few meters above the yellow taxis with the buildings blurring past, then he rises on the far side, looks toward the next building and releases the cable along the tangent, continuing forward on momentum. Side-tracking camera parallel with him. Audio: rushing wind, traffic below, cable tension.

Frame del aterrizaje en el taxi

Escena 3 · aterrizaje en el taxi

Cae sobre el techo de un taxi en movimiento, la suspensión se hunde y recupera, y rebota en diagonal disparando el segundo cable.

4 s

SHOT · 03_taxi_landing
Same man, same suit, same face as the reference photos. He descends toward the roof of a moving yellow taxi, extends both legs and lands on both forefeet; ankles, knees and hips flex to absorb, one hand briefly on the roof. The suspension dips and recovers, the taxi keeps moving. He looks toward the building on the right, drives up through both legs and pushes off diagonally, firing a second silver cable from his left wrist to a fire-escape bracket. Camera above the taxi hood looking backward. Audio: muted metal impact, suspension creak, boot traction.

Keyframe: primer contacto con la pared

Escena 4 · carrera por la pared

Tres pasos ascendentes por la fachada perdiendo velocidad porque la gravedad está activa, y agarre del pretil.

4 s

SHOT · 04_wall_run
Same man, same suit, same face as the reference photos. With the left cable taut he turns his hips so his feet meet the gray stone facade: right forefoot first with the knee flexing, then three quick ascending steps, right, left, right, losing speed because gravity is active. He pushes off with both legs, reaches the parapet and grips the stone with the right hand, elbow flexing, then the left hand joins. Side-tracking camera moving upward along the facade. Audio: three stone footfalls, cable retraction, glove grip, effort breath.

Keyframe: giro a cámara en la azotea

Escena 5 · llegada y giro a cámara

Sube el torso, pasa una pierna, dos pasos de recuperación, respira, y gira a cámara en secuencia anatómica: ojos, cabeza, hombros, torso, caderas, pies.

4 s

SHOT · 05_rooftop_turn
Same man, same suit, same face as the reference photos — his face must be clearly recognizable as the man in the reference photos. Both hands grip the parapet; he pulls his torso up, swings his right leg over, plants the right foot and brings the left leg over. Two short recovery steps forward, he stops, breathes, the wind moves his hair. He turns to camera in a natural sequence: eyes, head, shoulders, torso, hips, feet. He settles into a relaxed frontal medium shot from waist to head, VLA logo centered, mouth closed, calm confident expression. He does not speak. Camera arcs gently from behind him into a frontal eye-level medium shot. Audio: rooftop wind, fabric, footfalls, distant traffic.

Frame del cierre hablando a cámara

Escena 6 · el cierre hablando a cámara

La única escena con audio de referencia: el motor sincroniza los labios con la voz clonada. El gesto está coreografiado por frase.

8 s · con reference_audio

CTA_rooftop
Use the uploaded person as the sole identity reference. Preserve the exact facial features, facial proportions, hairstyle, beard, skin tone, body shape and age in every frame. Absolutely no face drift, no identity change, no beautification, no stylization, no anatomy distortion.

Eye-level frontal medium close-up, waist to head, on a Manhattan rooftop at golden hour. He wears the navy-blue technical suit with orange piping and the full-color VLA logo centered on the chest, no mask. The camera is nearly locked with a very subtle push-in.

He looks directly into the lens, inhales gently, blinks once, and speaks the words of the reference audio in Spanish with accurate lip synchronization. During the first phrase he makes one small open-hand gesture toward the city with his right hand. When he names the brand he briefly indicates the VLA logo on his chest without covering it, then lowers the hand. Natural eyebrow and cheek movement, irregular blinking, visible breathing, hair moved by the rooftop wind. He finishes with a restrained confident smile and holds eye contact.

Manhattan skyline soft and out of focus behind him. Photorealistic premium live-action commercial, no internal cuts, no text on screen. --ratio 9:16 --resolution 720p --duration 8

PASO 5

La llamada exacta al motor

El prompt es solo el primer elemento de un arreglo. Lo que hace o rompe la consistencia es qué referencias acompañan a ese texto y en qué rol. Ésta es la estructura literal del cuerpo de la petición:

POST /api/v3/contents/generations/tasksBytePlus Ark
{
  "model": "dreamina-seedance-2-0-260128",
  "generate_audio": true,
  "content": [
    { "type": "text", "text": "<los 5 bloques + SHOT + --ratio 9:16 --resolution 720p --duration 4>" },

    // Los 3 assets verificados van SIEMPRE, en TODAS las escenas.
    { "type": "image_url", "role": "reference_image", "image_url": { "url": "asset://asset-...-l5pgx" } },
    { "type": "image_url", "role": "reference_image", "image_url": { "url": "asset://asset-...-tdxsp" } },
    { "type": "image_url", "role": "reference_image", "image_url": { "url": "asset://asset-...-2llt4" } },

    // Primera escena: la vista canónica como ancla visual.
    { "type": "image_url", "role": "reference_image", "image_url": { "url": "https://.../vista-canonica.jpg" } },

    // Escenas siguientes: el video anterior, para heredar encuadre y luz.
    { "type": "video_url", "role": "reference_video", "video_url": { "url": "<url del clip previo>" } },

    // Solo en la escena que habla: la voz manda el lip-sync.
    { "type": "audio_url", "role": "reference_audio", "audio_url": { "url": "https://.../voz.mp3" } }
  ]
}

Las cuatro reglas del motor que aprendimos rompiéndolas

  • Los assets verificados van en cada escena. Ésta es la corrección que salvó el proyecto. Encadenar solo por reference_video acumula deriva; reinyectar las referencias la corta.
  • reference_video y reference_image se pueden combinar. No está documentado, pero funciona, y es justamente lo que permite heredar la continuidad del plano anterior sin perder la identidad.
  • first_frame/last_frame y los reference_* son escenarios mutuamente excluyentes. Si los mezclás, el motor devuelve InvalidParameter. Hay que elegir: o trabajás por fotogramas fijos, o trabajás por referencias.
  • La duración solo acepta enteros de 4 a 15 segundos. No hay 3,5 ni 20. Si tu escena necesita más, se parte — y ahí volvés a la regla de menos cortes: partila lo menos posible.
PASO 6

La voz, y una lección de redacción que no es técnica

La voz es un clon de la voz real, generado con ElevenLabs. Los parámetros importan menos de lo que parece; lo que importa es la estabilidad baja con similitud alta: deja entrar entonación natural sin dejar de sonar a la misma persona.

síntesis de vozElevenLabs multilingual v2
voiceSettings: { stability: 0.45, similarity_boost: 0.95 }

Ahora la parte interesante. El primer cierre decía el nombre del programa en inglés dentro de una frase en español, y sonaba mal — no por la voz, sino porque obliga a un cambio de acento en medio de la oración. Se probaron tres versiones:

tres variantes del cierre
A — Si querés crear contenido así, matriculate en la Máquina de Contenido de VLA.
B — ¿Querés crear contenido así? Matriculate en VLA, en nuestro programa Máquina de Contenido.
C — Si querés crear contenido así, matriculate en VLA, en el programa AI Content Machine.

La A es la más limpia: una sola frase, un solo idioma. La B respira mejor porque parte en dos. La C conserva el nombre comercial real y paga el precio fonético. No hay una respuesta universal — pero sí una regla: escribí el guion para la boca, no para el documento.

Orden de trabajo

La voz se genera antes del video, no después. La duración real del audio decide la duración de la escena. Si generás la escena primero y después el audio, te va a sobrar o faltar tiempo y vas a terminar recortando palabras.

PASO 7

Ensamblar y cerrar la marca

Los clips salen sueltos. El ensamblado es un concat de ffmpeg, sin transiciones: los cortes funcionan porque cada escena termina en la postura con la que arranca la siguiente.

ensamblado finalffmpeg
ffmpeg -f concat -safe 0 -i lista.txt -c:v libx264 -crf 20 -pix_fmt yuv420p -c:a aac salida.mp4

Donde lista.txt tiene una línea file '01_jump_launch.mp4' por clip, en orden.

El logo se compone, nunca se dibuja

Ningún motor de imagen dibuja bien un logo real: te lo deforma, le cambia los colores, le inventa letras. El logo verdadero se compone encima con una herramienta de imagen, y después se hace una pasada de image-to-image solo para integrarlo a la tela: que siga el pliegue, que reciba la misma luz. Fijate en la hoja de personaje de arriba: el traje no tiene logo. El logo llegó después.

Y las piezas gráficas del mismo mundo

El video no viaja solo. Con el mismo personaje y el mismo vestuario canónico se generan los estáticos del carrusel — misma biblia, otro formato.

Slide del carrusel: el filamento como hilo narrativo
Slide del carrusel: el filamento como hilo narrativo
Los cursos como cajas físicas de software, con el logo real compuesto
Los cursos como cajas físicas de software, con el logo real compuesto
LO QUE SALIÓ MAL

Seis errores reales y cómo se arreglaron

Esta tabla vale más que el resto de la guía, porque es lo que nadie publica.

El síntoma La causa real El arreglo
La cara ya no era la misma en las últimas escenas Encadenar cada escena usando solo el video anterior como referencia. La deriva es gradual e invisible clip por clip. Reinyectar los assets verificados en todas las escenas, además del video previo.
El cable salía rojo El motor asociaba el objeto con una referencia conocida. Decir «plateado» no bastaba. Un bloque dedicado, en positivo y en negativo: «es plateado, NO es rojo, NO es una telaraña».
Tomas que se movían hacia atrás Ambigüedad temporal: cuando el motor duda, genera movimiento reversible. Una línea que fija la dirección del tiempo y del desplazamiento.
Cara «mejorada» que ya no era la persona El motor embellece por defecto: alisa, simetriza, afina. Prohibirlo textualmente: no beautification, no stylization.
Generaciones rechazadas por copyright El emblema y la pose disparaban el filtro visualmente, no solo por el texto. Rediseñar el personaje de verdad: otro emblema, otra tecnología, otra paleta.
Imágenes de referencia rechazadas por privacidad Cualquier cara realista por URL pública dispara el filtro de privacidad. Assets verificados en la biblioteca del proveedor + vistas generadas sobre fondo de estudio.
PARA REPLICARLO

La lista, en orden

  • Escribí la biblia del personaje: identidad, cuerpo, vestuario con hexadecimales y medidas, reglas de continuidad y negativos.
  • Generá cinco vistas canónicas por image-to-image desde una sola foto ancla, sobre fondo de estudio gris.
  • Si la cara es de una persona real, registrala y verificala en la biblioteca de assets del proveedor.
  • Armá los cinco bloques de bloqueo una vez. No los vuelvas a escribir: se copian idénticos en cada escena.
  • Escribí cada acción en biomecánica, no en adjetivos. Antepiés, rodillas, caderas, vectores.
  • Preferí una toma larga con timeline interno antes que varias escenas cortas.
  • Generá la voz primero y dejá que su duración real defina la escena que habla.
  • Mandá los assets verificados en cada llamada, más el video previo para heredar continuidad.
  • Componé el logo real encima y hacé una pasada de integración a la tela.
  • Ensamblá con concat y revisá cuatro cosas: identidad, el objeto crítico, la dirección del movimiento y el peso.
COSTO Y TIEMPO

Lo que cuesta de verdad

El corte final se compone de nueve clips generados. A un costo estimado de $0,75 por clip de video y $0,10 por línea de voz, el material que quedó en pantalla cuesta menos de diez dólares. Contando los descartes —dos versiones completas del bloque de acción, tres variantes de voz, varias generaciones rechazadas por el filtro y la tanda de vistas del personaje— la producción entera se movió en el orden de las decenas de dólares, no de los miles.

El tiempo real no se fue en generar: se fue en descubrir las reglas del motor. Cada clip tarda unos minutos. La parte cara fue entender por qué la cara derivaba, por qué el cable salía rojo y por qué el filtro rechazaba las referencias. Eso es lo que esta guía te ahorra.

Sobre estas cifras

Los precios son los estimados documentados en nuestro sistema de costos, no facturación exacta del proveedor: ninguno de estos motores expone un costo por llamada. Tomalos como orden de magnitud.

EL SIGUIENTE PASO

Aprendé a hacer esto con nosotros

Esta guía es el método de una pieza. Lo que no cabe acá es el criterio: cómo se escribe
una acción que el motor entienda, cuándo una toma sirve, y cómo se arma un sistema que
produzca esto cada semana en vez de una sola vez. Eso es AI Content Machine.

Reservá tu lugar

Te contactamos con fechas, cupos e inversión

o si preferís hablar ya con alguien

Te responde una persona del equipo, no un bot.

Ver el programa completo →

Si querés aprender a hacer esto en serio

Esta guía es el método completo de una pieza. Lo que no cabe acá es el criterio: cuándo una toma sirve, cómo se escribe una acción que el motor entienda, cómo se arma un sistema que produzca esto todas las semanas en lugar de una vez.

Eso es VLA AI Content Machine: ver el programa y las fechas. Somos VLA Academy, academia de certificaciones tech con sede en Costa Rica y Doral, Miami.

VLA Webrunner es un personaje original de VLA Academy. Producido con Seedance 2.0 (BytePlus), Seedream 5 Pro y ElevenLabs. La identidad de la persona en pantalla es real y está verificada por el proveedor; no se usó la imagen de nadie más.