Qué vas a tener cuando termines
Escenas, actores, anuncios de producto y voz en off generados, con el mismo personaje en todas las tomas.
- No quiero salir en cámaraun video de menos de un minuto con 5 a 8 escenas generadas, el mismo personaje en todas y la voz en off encima, listo para publicar; o tu clon de avatar y su primer video.
- Quiero anuncios de producto sin fotógrafoun anuncio de 10 segundos de tu producto, con fondo, luz y movimiento de cámara generados a partir de una foto real, con voz en off, y la etiqueta, el color y las proporciones revisados contra la foto.
- Quiero b-roll que no existelos clips de apoyo de 3 a 6 segundos que tu guion necesita y que nadie grabó (el celular que se enciende de madrugada, la tienda que abre, el gráfico que sube), listos para intercalar en tu video hablado o sin cámara.
Elige la situación que es la tuya. La página te lleva paso a paso solo por esa.
Video sin cámara
Escenas, actores, anuncios de producto y voz en off generados, con el mismo personaje en todas las tomas.
Tipo: prompt · Para: dueños de negocio, marcas personales y quien vende IA que necesitan video (escenas, anuncios, b-roll) sin grabar nada · Tiempo: una tarde el primer video; los siguientes, una hora
Cómo usar esta página
Copia esta página entera (el botón «Copiar todo» de arriba) y pégala en un chat nuevo de Claude. Claude va a leer las instrucciones de abajo y te va a guiar paso a paso, una pregunta a la vez, hasta que lo tengas hecho.
INSTRUCCIONES PARA CLAUDE (si eres Claude y te pegaron esta página, síguelas):
- Eres el asistente que Ignacio Giaverini (CreaVinci) preparó para este recurso. Hablas en español neutro, tú.
- Primero pregúntale a la persona en cuál de estas situaciones está: 1) no quiere salir en cámara; 2) quiere anuncios de producto sin fotógrafo; 3) quiere b-roll que no existe. Una sola pregunta.
- Después sigue el paso a paso de ESE ángulo, un paso por mensaje, y no avances hasta que te confirme que lo hizo.
- Cuando un paso use una pieza (un prompt, una skill, una plantilla), se la das completa, lista para copiar.
- Si algo falla, ve a «Errores conocidos» antes de improvisar.
- No inventes cifras ni casos. No prometas lo que la página no dice.
- Al terminar, dile qué tiene hecho y cuál es el siguiente paso natural (está al final de la página).
Para quién es, y cuándo no
- Es para ti si tienes algo que decir (un guion, una oferta, un producto) y lo que te frena es la cámara: no quieres salir, no tienes fotógrafo, o lo que quieres mostrar no existe grabado. Necesitas Claude (la app o Claude Code), un modelo de imagen y uno de video (los prompts sirven en cualquiera) y una tarde.
- No es para ti (todavía) si no tienes guion: cada escena ilustra una frase. → Entonces escribe entre 5 y 8 frases, una por escena, y vuelve con ese texto.
- No es para ti si quieres reemplazar tu cara en tu marca personal con un presentador generado: la gente lo nota. → Entonces usa el clon solo para avisos y recordatorios (Pieza E) y sigue grabando tú tus reels principales.
- No es para ti si vendes algo que la gente necesita ver exacto (joyas, alimentos con etiqueta legal): ahí la IA solo pone fondo, luz y movimiento sobre la foto real (Pieza F), nunca redibuja el producto.
Ángulo 1 · «No quiero salir en cámara»
Qué vas a tener al final: un video de menos de un minuto con 5 a 8 escenas generadas, el mismo personaje en todas y la voz en off encima, listo para publicar; o tu clon de avatar y su primer video.
- Elige la variante: (a) un personaje generado que actúa mientras una voz en off cuenta la historia (explicaciones, historias de cliente, anuncios): pasos 2 a 10. (b) Un presentador generado que habla a cámara, solo para b-roll y anuncios, nunca por ti en tu marca personal: paso 11. (c) Tu propia cara y tu voz sin grabar ese día, solo para avisos y respuestas cortas: paso 12.
- Escribe el guion de la voz en off: 5 a 8 frases, una por escena, y cada frase se lee en 3 a 6 segundos. Con puntos y comas donde respirarías: la voz generada respira por puntuación.
- Escribe la ficha de personaje con la regla 1 de la Pieza C, una sola vez, y pégala idéntica en todos los prompts: si cambias una palabra, cambia la persona.
- Escribe cada escena en una línea, con un solo cambio respecto de la anterior (regla 3 de la Pieza C). El plano sale de la Pieza A: copia el prompt más parecido a lo que quieres mostrar y cambia el sujeto.
- Convierte cada línea en un JSON con el prompt director de fotografía de la Pieza B, una escena por corrida, y guarda cada JSON. Si vuelve con dos sujetos moviéndose o un adjetivo de emoción, corrígelo ahí, en el texto.
- Genera la escena 1 como imagen (no como video) con la ficha más su JSON. Corrige hasta que el encuadre, la luz y sobre todo el personaje estén bien. Esa imagen es la referencia de todo el video: guárdala.
- Genera las escenas 2 en adelante como imagen, adjuntando siempre la referencia más la ficha más el cambio de esa escena (regla 2 de la Pieza C). De a una, comparando cada una con la referencia.
- Genera el video de cada imagen dándole al modelo de video solo
accionymovimiento_camarade su JSON: debe mover la escena, no reinventarla. De a uno. - Genera la voz con la Pieza G, un audio por escena (nunca uno solo largo), y mide la duración de cada uno. Corta o alarga cada clip a la duración de su audio, nunca al revés.
- Pega el audio de cada toma sobre su toma y une las tomas con cortes secos, con los comandos de la Pieza G (o con su prompt para Claude Code, que hace todo eso por ti). Ese es tu video sin cámara.
- Solo variante (b): sigue el orden de la Pieza D: la cara con el modelo de imagen hasta que sea la que quieres; la voz con la Pieza G (siempre antes del movimiento); el movimiento con el modelo de animación, con la imagen y el audio adjuntos. Monta como en el paso 10.
- Solo variante (c): sigue la Pieza E entera: grabas una sola vez el video base con su ficha, clonas la voz, aplicas los cuatro ajustes de la boca y generas tu primer aviso con el prompt de la pieza, mirando la vista previa antes de generar entero.
Cómo sabes que quedó bien: las imágenes clave en una fila muestran la misma persona en todas; la última palabra de cada frase cae antes de que termine su toma, sin tomas mudas ni frases cortadas; no hay manos deformadas ni texto en el fondo.
Ángulo 2 · «Quiero anuncios de producto sin fotógrafo»
Qué vas a tener al final: un anuncio de 10 segundos de tu producto, con fondo, luz y movimiento de cámara generados a partir de una foto real, con voz en off, y la etiqueta, el color y las proporciones revisados contra la foto.
- Toma la foto real del producto. Con el celular sirve: sobre una hoja blanca, junto a una ventana, sin sombra dura, con la etiqueta de frente. Esa foto ES el producto; el modelo solo le pone el escenario.
- Elige dos o tres de los cinco encuadres de la Pieza F, no los cinco. Producto que se usa en la mano: 1 (etiqueta) más 5 (escala) más 4 (textura). Producto de mesa (comida, cosmética, decoración): 2 (forma) más 3 (uso) más 4.
- Genera la imagen de cada encuadre con el prompt del paso 1 de la Pieza F, con la foto real adjunta. Una a la vez, y antes de la siguiente revísala con la tabla de errores de marca de la misma pieza; si falla, se vuelve a generar con la corrección de la tabla. Nunca se anima una imagen mala.
- Genera la animación de cada imagen con el prompt del paso 2 de la Pieza F: un movimiento de cámara, un solo elemento físico, 6 segundos, sin cortes. De a una.
- Escribe la voz en off: dos o tres frases que quepan en 10 segundos (unas 25 palabras). Genérala con la Pieza G (para anuncios su tabla indica es-MX-DaliaNeural; prueba las cuatro antes de decidir) y mide la duración del audio.
- Monta: recorta cada clip para que el total dé lo que dura la voz (9 a 10 segundos), con cortes secos, y pega el audio con los comandos de la Pieza G. Si tiene que durar más que la voz, el último clip corre en silencio; nunca aceleres el audio.
- El copy y el llamado a la acción van encima en la edición, escritos por ti, nunca generados dentro de la imagen: cualquier palabra que el modelo dibuje sale con letras inventadas.
- Opcional, si el anuncio necesita una persona que hable del producto a cámara: usa la Pieza D para un presentador en plano medio corto, sin manos, como una toma más. Si el producto tiene que estar en la mano, esa toma es el encuadre 5 de la Pieza F, no el actor.
Cómo sabes que quedó bien: la foto real y el fotograma final lado a lado: la etiqueta se lee igual letra por letra, el envase tiene el mismo tono, el producto no sale más alto ni más ancho. Dura 10 segundos, la voz termina antes del último corte y no hay palabras en el fondo. Si la etiqueta cambió en un solo fotograma, ese clip se vuelve a generar.
Ángulo 3 · «Quiero b-roll que no existe»
Qué vas a tener al final: los clips de apoyo de 3 a 6 segundos que tu guion necesita y que nadie grabó (el celular que se enciende de madrugada, la tienda que abre, el gráfico que sube), listos para intercalar en tu video hablado o sin cámara.
- Lee tu guion frase por frase y escribe al lado de cada una qué habría que MOSTRAR, no lo que dice: «el setter responde de madrugada» se muestra como «un celular se enciende sobre una mesa de noche a oscuras». Un concepto por frase, en presente, con una sola acción.
- Para cada concepto, busca en los cien prompts de la Pieza A el que más se acerque dentro de su grupo (trabajo, resultado, estilo de vida, producto o transición). Cópialo y cambia solo el sujeto y la acción; el resto ya está elegido.
- Si el plano necesita precisión (una luz con fuente y dirección, un fondo concreto, una duración exacta), pásalo por el prompt director de fotografía de la Pieza B y usa el JSON. Para un clip suelto sin personaje, el prompt de la Pieza A tal cual alcanza.
- Si una persona aparece en más de un clip, escribe su ficha con la Pieza C, pégala en todos los prompts donde salga y adjunta la imagen de referencia desde el segundo clip. Sin eso, cada clip trae una persona distinta.
- Genera la imagen de cada plano primero y corrige ahí hasta que esté; después el video con solo el movimiento. De a uno: generas, miras el clip entero, y recién entonces el siguiente.
- Elige el clip mirando el fotograma, no la miniatura: se ve entero, la física es real (el vapor sube, la tela se mueve, el cabello no se congela) y no hay manos raras ni texto en el fondo.
- Corta cada clip a la duración de la frase que ilustra (3 a 6 segundos) e intercálalo con cortes secos. Si el video lo hablas tú, el b-roll va encima de tu voz; si es sin cámara, la voz sale de la Pieza G, una por toma.
Cómo sabes que quedó bien: cada clip muestra una sola acción, se entiende sin la voz y termina cuando termina su frase. Ninguna toma tiene dos sujetos moviéndose ni manos en primer plano, y un personaje repetido es la misma persona en todos.
Las piezas
Pieza A · 100 prompts de plano (plantilla)
Cien prompts escritos como planos (encuadre, lente, luz, movimiento, física, una acción), agrupados por uso. Un modelo de video falla cuando el prompt describe una idea y funciona cuando describe un plano. En los tres ángulos; en el 3 es la pieza principal. Que un personaje salga igual en dos clips lo resuelve la Pieza C.
EL ORDEN QUE SÍ FUNCIONA
Imagen primero (el fotograma clave con el prompt del plano; se corrige ahí, que es barato), video después (esa imagen al modelo de video con SOLO el movimiento y la acción: no debe reinventar la escena, debe moverla), y de a uno (lanzar diez a la vez es la forma más cara de descubrir que el prompt estaba mal).
LA ANATOMÍA DE CADA PROMPT
[ENCUADRE] plano medio / plano cerrado / plano general / picado / contrapicado
[LENTE] 24 mm (amplio) · 35 mm (natural) · 50 mm (retrato) · 85 mm (fondo desenfocado)
[LUZ] ventana lateral suave / dorada de atardecer / neón frío / contraluz
[MOVIMIENTO] fija / avanza lento / lateral lento / orbita / a mano
[FÍSICA] qué se mueve de verdad: cabello, tela, humo, agua, partículas
[SUJETO Y ACCIÓN] una acción, en presente
B-ROLL DE TRABAJO
1. Plano cerrado, 85 mm, luz de ventana lateral, cámara fija; manos escribiendo en un teclado, el vapor de una taza al lado.
2. Plano medio, 35 mm, luz de estudio, a mano; alguien dibuja en una pizarra y se aleja para mirar.
3. Picado, 24 mm, luz de mediodía, fija; un escritorio ordenado desde arriba, una mano mueve una hoja.
4. Plano cerrado, 85 mm, luz cálida, avanza lento; ojos que leen una pantalla, el reflejo de la pantalla en ellos.
5. Plano medio, 50 mm, luz de ventana lateral, fija; una persona escribe en una libreta, un mechón cae sobre la frente.
6. Plano cerrado, 85 mm, luz fría de pantalla, avanza lento; un dedo desliza sobre un celular, el brillo cambia en la piel.
7. Plano general, 24 mm, luz de mañana, lateral lento; una oficina vacía, las cortinas se mueven con el aire.
8. Plano medio, 35 mm, luz de ventana, a mano; dos personas miran un mismo monitor, una señala con el lápiz.
9. Plano cerrado, 50 mm, luz cálida de lámpara, fija; una mano pasa las páginas de un cuaderno, polvo en el haz de luz.
10. Contrapicado, 35 mm, luz de techo, orbita lento; una persona de pie frente a una pared llena de notas adhesivas.
11. Plano cerrado, 85 mm, luz de ventana, fija; un cursor parpadea en un documento vacío, la ventana reflejada en la pantalla.
12. Plano medio, 50 mm, luz lateral suave, avanza lento; una persona con audífonos asiente mientras escucha, el cable se balancea.
13. Picado, 35 mm, luz de mediodía, fija; una mesa con celular, café y libreta, una mano toma el celular.
14. Plano cerrado, 85 mm, contraluz de ventana, lateral lento; unos lentes sobre el escritorio, el sol atraviesa los cristales.
15. Plano medio, 35 mm, neón frío, a mano; una persona trabaja de noche frente a dos monitores, luz azul en la cara.
16. Plano general, 24 mm, luz dorada de atardecer, fija; un escritorio en casa, la sombra de la ventana avanza por el piso.
17. Plano cerrado, 50 mm, luz de estudio, fija; un dedo aprieta la tecla de enviar, el teclado vibra apenas.
18. Plano medio, 50 mm, luz cálida, orbita lento; una persona lee una hoja impresa y frunce el ceño, el papel se curva.
19. Plano cerrado, 85 mm, luz de ventana, avanza lento; un reloj en la muñeca que escribe, el segundero avanza.
20. Plano medio, 35 mm, luz de mañana, lateral lento; alguien abre un portátil, la pantalla se enciende e ilumina el rostro.
B-ROLL DE RESULTADO
21. Plano medio, 50 mm, luz de ventana, fija; dos manos se estrechan sobre una mesa, papeles al lado.
22. Plano cerrado, 85 mm, luz cálida, avanza lento; una notificación aparece en un celular sobre la mesa, la pantalla se enciende.
23. Plano medio, 35 mm, luz de ventana lateral, a mano; una persona lee el celular, sonríe apenas y se recuesta en la silla.
24. Plano cerrado, 50 mm, luz de estudio, fija; una firma en un contrato, la punta del bolígrafo brilla.
25. Plano general, 24 mm, luz dorada de atardecer, lateral lento; una persona cierra el portátil y se levanta, la silla gira.
26. Plano medio, 50 mm, luz de mañana, orbita lento; alguien levanta los brazos frente a la pantalla, el cabello se mueve.
27. Plano cerrado, 85 mm, luz cálida de lámpara, fija; un gráfico sube en una pantalla, reflejado en unos lentes.
28. Plano medio, 35 mm, luz de ventana, avanza lento; una persona choca los cinco con otra fuera de cuadro, la manga se desliza.
29. Picado, 35 mm, luz de mediodía, fija; una caja de envío cerrada con cinta, una mano pega la etiqueta.
30. Plano cerrado, 50 mm, luz de ventana, lateral lento; una mano sirve café en dos tazas, el vapor sube.
31. Plano medio, 50 mm, luz de estudio, fija; una persona habla por teléfono y asiente, la mano libre en la mesa.
32. Plano general, 24 mm, luz de mañana, a mano; una tienda pequeña abre la cortina metálica, entra la luz.
33. Plano cerrado, 85 mm, luz cálida, avanza lento; una mano pone un cartel de «vendido» en una vitrina, el papel se curva.
34. Plano medio, 35 mm, luz de ventana lateral, fija; una persona responde en el celular, lo deja boca abajo y respira hondo.
35. Plano cerrado, 50 mm, luz dorada, orbita lento; una taza vacía junto a una libreta con una lista tachada.
36. Plano medio, 50 mm, contraluz de ventana, lateral lento; una persona mira por la ventana con la taza, el vapor cruza la luz.
37. Plano cerrado, 85 mm, luz de estudio, fija; una impresora saca una hoja, la hoja se dobla apenas al caer.
38. Plano general, 24 mm, luz de tarde, avanza lento; una sala de reunión vacía, una silla todavía girando.
39. Plano medio, 35 mm, luz cálida, a mano; dos personas brindan con café en un local, la ventana atrás.
40. Plano cerrado, 50 mm, luz de ventana, fija; un calendario de pared, una mano marca una fecha con un círculo.
B-ROLL DE ESTILO DE VIDA
41. Plano medio, 35 mm, luz dorada de atardecer, la cámara avanza lento; una persona mira por la ventana y se gira a cámara.
42. Plano general, 35 mm, amanecer, lateral lento; una persona corre por un camino de tierra, el aire mueve la ropa.
43. Plano cerrado, 85 mm, luz de mañana, fija; una mano abre una cortina, el polvo flota en la luz que entra.
44. Plano medio, 50 mm, luz de ventana, a mano; alguien prepara café en la cocina, el vapor sube de la cafetera.
45. Plano general, 24 mm, luz de tarde, avanza lento; una persona camina por una calle con árboles, las hojas se mueven.
46. Plano cerrado, 50 mm, luz cálida, orbita lento; un libro abierto sobre una manta, una mano pasa la página.
47. Plano medio, 35 mm, luz dorada, lateral lento; una persona anda en bicicleta por un parque, el cabello al viento.
48. Plano cerrado, 85 mm, contraluz de atardecer, fija; una mano fuera de la ventanilla de un auto, el aire empuja los dedos.
49. Plano medio, 50 mm, luz de ventana lateral, fija; alguien estira los brazos al despertar, la sábana se arruga.
50. Plano general, 24 mm, luz de mediodía, a mano; una persona camina por la playa con el celular, la espuma llega a los pies.
51. Plano cerrado, 50 mm, luz cálida de lámpara, avanza lento; una mano apaga la luz de la mesa de noche, la sombra crece.
52. Plano medio, 35 mm, luz de mañana, lateral lento; alguien riega una planta en el balcón, las gotas caen de las hojas.
53. Plano cerrado, 85 mm, luz de ventana, fija; un perro apoya la cabeza en una pierna, una mano lo acaricia.
54. Plano medio, 50 mm, luz dorada, orbita lento; una persona en una banca escribe en el celular, sombra de hojas en la cara.
55. Plano general, 24 mm, luz azul del amanecer, avanza lento; una ciudad desde una terraza, el vapor de una taza en primer plano.
56. Plano cerrado, 50 mm, luz de mañana, fija; una mano amarra los cordones de una zapatilla, la tela se tensa.
57. Plano medio, 35 mm, luz de tarde, a mano; alguien camina con auriculares y sonríe apenas, la chaqueta se mueve al andar.
58. Plano cerrado, 85 mm, luz cálida, lateral lento; una taza de té junto a una ventana con lluvia, las gotas corren por el vidrio.
59. Plano medio, 50 mm, luz de ventana, fija; una persona se estira en la sala, la camiseta se mueve con el gesto.
60. Plano general, 24 mm, luz dorada de atardecer, orbita lento; una persona sentada sobre un auto mira el horizonte, el pasto se mueve.
B-ROLL DE PRODUCTO
61. Plano cerrado, 50 mm, luz suave, orbita lento; un objeto sobre una mesa de madera, polvo flotando.
62. Plano cerrado frontal, 85 mm, luz de ventana lateral, fija; un frasco sobre mármol, etiqueta legible, una gota resbala por el vidrio.
63. Tres cuartos, 50 mm, luz de estudio con dos fuentes, orbita lento 30 grados; una caja de producto, la sombra gira con la cámara.
64. Cenital, 35 mm, luz dorada, fija; un producto sobre lino con una taza y una planta al lado, el vapor sube.
65. Plano cerrado a la textura, 85 mm, luz lateral dura, avanza lento; la superficie de una crema, una espátula la corta despacio.
66. Plano medio, 50 mm, luz de ventana, fija; un producto en una mano, sin cara, la manga se mueve apenas.
67. Plano cerrado, 85 mm, luz cálida, lateral lento; la miga de un pan recién cortado, el vapor sale del corte.
68. Plano cerrado, 50 mm, luz fría de estudio, fija; una botella con gotas de condensación, una gota cae.
69. Tres cuartos, 50 mm, luz dorada de atardecer, orbita lento; un par de zapatillas sobre concreto, el polvo se levanta apenas.
70. Cenital, 35 mm, luz de mediodía, avanza lento; ingredientes ordenados sobre madera, una mano coloca el último.
71. Plano cerrado, 85 mm, contraluz suave, fija; un perfume de vidrio, la luz atraviesa el líquido y se refleja en la mesa.
72. Plano cerrado a la textura, 85 mm, luz lateral, lateral lento; un tejido de lana en relieve, una mano lo recorre.
73. Plano medio, 50 mm, luz de ventana, fija; una taza de cerámica entre dos manos, el vapor sube entre los dedos.
74. Tres cuartos, 50 mm, luz de estudio, orbita lento; un dispositivo sobre una superficie oscura, la luz recorre el borde.
75. Cenital, 24 mm, luz de mañana, fija; una mesa puesta con un plato al centro, una mano deja el tenedor.
76. Plano cerrado, 85 mm, luz dorada, avanza lento; una vela encendida, la llama se mueve, una gota de cera cae.
77. Plano cerrado a la textura, 85 mm, luz lateral, fija; una tableta de chocolate se quiebra, las astillas caen.
78. Plano medio, 50 mm, luz de ventana, lateral lento; una bolsa de tela con logo colgada en una silla, se balancea.
79. Tres cuartos, 50 mm, neón frío, orbita lento; una lata sobre metal mojado, reflejos de color en la superficie.
80. Plano cerrado, 85 mm, luz cálida, fija; un reloj sobre cuero, la luz gira apenas sobre el vidrio.
B-ROLL DE TRANSICIÓN
81. Plano general, 24 mm, neón frío, lateral lento; una calle mojada de noche, reflejos en el suelo.
82. Contrapicado, 50 mm, contraluz, fija; una silueta abre una puerta y entra luz.
83. Plano cerrado, 85 mm, luz cálida, avanza lento; una mano apaga un interruptor, la sala queda a oscuras.
84. Plano general, 24 mm, luz de mañana, fija; nubes pasan rápido sobre un edificio, la sombra recorre la fachada.
85. Plano cerrado, 50 mm, luz de ventana, lateral lento; una cortina blanca se mueve con el viento y tapa el cuadro.
86. Plano medio, 35 mm, luz de tarde, a mano; una persona cruza delante de la cámara y tapa el lente un instante.
87. Plano cerrado, 85 mm, contraluz, fija; humo que sube y llena el cuadro, la luz lo atraviesa.
88. Plano general, 24 mm, luz dorada, avanza lento; un pasillo largo, una puerta al fondo se abre.
89. Plano cerrado, 50 mm, luz de estudio, orbita lento; un vaso de agua, una gota cae y el reflejo tiembla.
90. Picado, 35 mm, luz de mediodía, fija; una hoja en blanco sobre una mesa, el viento la levanta.
91. Plano cerrado, 85 mm, luz fría, avanza lento; una pantalla se apaga y refleja la habitación.
92. Plano general, 24 mm, amanecer, lateral lento; una carretera vacía, la niebla se mueve sobre el asfalto.
93. Plano cerrado, 50 mm, luz cálida, fija; un reloj de pared, el minutero salta.
94. Plano medio, 35 mm, contraluz de ventana, avanza lento; una persona se levanta y sale de cuadro, la silla gira.
95. Plano cerrado, 85 mm, luz de tarde, lateral lento; la sombra de unas persianas avanza sobre una pared blanca.
96. Plano general, 24 mm, neón frío, a mano; una escalera de metro, gente desenfocada sube, un letrero parpadea.
97. Plano cerrado, 50 mm, luz dorada, fija; una llave gira en una cerradura, la puerta se entreabre.
98. Plano medio, 35 mm, luz de estudio, orbita lento; una lámpara de escritorio se enciende y define la mesa.
99. Plano cerrado, 85 mm, luz cálida, avanza lento; gotas de lluvia en un vidrio, luces de la ciudad desenfocadas atrás.
100. Plano general, 24 mm, luz de mañana, fija; una ventana abierta con la ciudad afuera, la cortina se mueve y entra la luz.
Pieza B · Claude como director de fotografía (prompt + 8 JSON de escena)
Convierte una escena escrita en una línea en el JSON que los generadores leen mejor que una frase. Al modelo de imagen se le pega el JSON entero; al de video, la imagen más accion y movimiento_camara. Ángulo 1 en cada escena; ángulo 3 cuando el plano necesita precisión. El mismo personaje en dos escenas lo garantiza la Pieza C.
El prompt que hace de director (se corre en Claude, una vez por escena):
Eres director de fotografía. Voy a describirte una escena en una línea y tú la conviertes en un JSON con estos campos exactos: encuadre, lente_mm, luz (fuente, direccion, temperatura), sujeto (quien o qué, ropa o material, posicion), accion (una, en presente), movimiento_camara (tipo y velocidad), fisica (qué se mueve: tela, cabello, humo, agua), fondo, duracion_s (entre 3 y 6), estilo (referencia de look en 5 palabras).
Reglas: una acción por escena; nunca dos sujetos moviéndose; la luz siempre tiene fuente y dirección; nada de adjetivos de emoción («triste», «feliz»): la emoción se muestra con la acción y la luz.
Escena: [una línea].
Los 8 JSON, listos para pegar. Donde aparece una persona es la misma en todos (mujer de 40 años, camisa blanca de lino) y cambia una sola cosa por escena; cambia la ficha por la tuya y el resto queda igual.
Escena 1 · Escritorio
{
"encuadre":"plano medio",
"lente_mm":35,
"luz":{"fuente":"ventana","direccion":"lateral izquierda","temperatura":"cálida, atardecer"},
"sujeto":{"quien":"una mujer de 40 años","ropa":"camisa blanca de lino","posicion":"sentada frente a una mesa de madera"},
"accion":"levanta la vista de la libreta y mira por la ventana",
"movimiento_camara":{"tipo":"avance lento","velocidad":"muy lenta"},
"fisica":"el cabello se mueve apenas con el aire; el vapor de una taza sube",
"fondo":"pared clara, una planta desenfocada",
"duracion_s":5,
"estilo":"cine natural, grano fino, colores cálidos"
}
Escena 2 · Resultado
{
"encuadre":"plano medio",
"lente_mm":50,
"luz":{"fuente":"ventana","direccion":"lateral izquierda","temperatura":"cálida, atardecer"},
"sujeto":{"quien":"una mujer de 40 años","ropa":"camisa blanca de lino","posicion":"sentada frente a un portátil en la misma mesa de madera"},
"accion":"lee la pantalla, se recuesta en la silla y suelta el aire despacio",
"movimiento_camara":{"tipo":"fija","velocidad":"ninguna"},
"fisica":"la silla cede apenas al recostarse; el reflejo de la pantalla cambia sobre su cara",
"fondo":"pared clara, una planta desenfocada",
"duracion_s":5,
"estilo":"cine natural, grano fino, colores cálidos"
}
Escena 3 · Estilo de vida
{
"encuadre":"plano general",
"lente_mm":24,
"luz":{"fuente":"sol","direccion":"contraluz desde atrás","temperatura":"dorada, tarde"},
"sujeto":{"quien":"una mujer de 40 años","ropa":"camisa blanca de lino","posicion":"caminando por una vereda con árboles, un café en la mano"},
"accion":"camina hacia cámara y bebe un sorbo sin detenerse",
"movimiento_camara":{"tipo":"retroceso lento","velocidad":"lenta, a la velocidad de ella"},
"fisica":"las hojas se mueven con el viento; el vapor del café se dispersa",
"fondo":"calle residencial desenfocada, luz entre los árboles",
"duracion_s":6,
"estilo":"cine natural, grano fino, colores cálidos"
}
Escena 4 · Producto
{
"encuadre":"plano cerrado frontal a la altura del producto",
"lente_mm":85,
"luz":{"fuente":"ventana","direccion":"lateral derecha","temperatura":"neutra, mañana"},
"sujeto":{"quien":"un frasco de vidrio ámbar con etiqueta blanca","ropa":"etiqueta exactamente como la foto de referencia","posicion":"de pie sobre mármol claro"},
"accion":"una gota de condensación resbala por el vidrio",
"movimiento_camara":{"tipo":"órbita de 30 grados","velocidad":"muy lenta"},
"fisica":"la gota baja; el reflejo de la ventana se desplaza sobre el vidrio",
"fondo":"lino beige desenfocado, sin objetos",
"duracion_s":6,
"estilo":"fotografía de producto, limpia, tonos neutros"
}
Escena 5 · Pantalla
{
"encuadre":"plano cerrado",
"lente_mm":85,
"luz":{"fuente":"la propia pantalla","direccion":"frontal","temperatura":"fría, azul suave"},
"sujeto":{"quien":"la pantalla de un portátil con una bandeja de mensajes","ropa":"vidrio mate, marco oscuro","posicion":"sobre un escritorio, en ángulo leve"},
"accion":"una notificación nueva aparece arriba de la lista y la lista baja un lugar",
"movimiento_camara":{"tipo":"avance lento","velocidad":"muy lenta"},
"fisica":"el brillo de la pantalla cambia sobre el teclado al aparecer la notificación",
"fondo":"habitación en penumbra, una lámpara cálida desenfocada",
"duracion_s":4,
"estilo":"cine tecnológico sobrio, contraste suave"
}
Escena 6 · Manos
{
"encuadre":"plano cerrado",
"lente_mm":85,
"luz":{"fuente":"ventana","direccion":"lateral izquierda","temperatura":"cálida, atardecer"},
"sujeto":{"quien":"las manos de una mujer de 40 años","ropa":"puños de camisa blanca de lino doblados","posicion":"sobre un teclado, en la mesa de madera"},
"accion":"termina de escribir una línea y aprieta una sola tecla",
"movimiento_camara":{"tipo":"fija","velocidad":"ninguna"},
"fisica":"las teclas se hunden; el vapor de la taza cruza el cuadro",
"fondo":"el borde del portátil, desenfocado",
"duracion_s":4,
"estilo":"cine natural, grano fino, colores cálidos"
}
Escena 7 · Transición
{
"encuadre":"contrapicado",
"lente_mm":50,
"luz":{"fuente":"sol","direccion":"contraluz desde el vano de la puerta","temperatura":"dorada, tarde"},
"sujeto":{"quien":"una puerta de madera cerrada","ropa":"madera clara, manilla metálica","posicion":"al final de un pasillo en penumbra"},
"accion":"la puerta se abre hacia afuera y la luz entra en el pasillo",
"movimiento_camara":{"tipo":"avance lento","velocidad":"lenta"},
"fisica":"polvo suspendido en el haz de luz; la sombra de la puerta corre por el piso",
"fondo":"pasillo con paredes lisas, sin cuadros",
"duracion_s":4,
"estilo":"cine natural, contraste alto, cálido"
}
Escena 8 · Cierre
{
"encuadre":"plano medio corto",
"lente_mm":85,
"luz":{"fuente":"ventana","direccion":"lateral izquierda","temperatura":"cálida, atardecer"},
"sujeto":{"quien":"una mujer de 40 años","ropa":"camisa blanca de lino","posicion":"de pie junto a la ventana, en la habitación de la escena 1"},
"accion":"gira la cabeza desde la ventana hacia la cámara y sostiene la mirada",
"movimiento_camara":{"tipo":"fija","velocidad":"ninguna"},
"fisica":"un mechón de cabello se mueve con el aire; parpadea una vez",
"fondo":"pared clara, la planta desenfocada",
"duracion_s":4,
"estilo":"cine natural, grano fino, colores cálidos"
}
Pieza C · Escena sin cámara (prompt encadenado)
La ficha de personaje, los prompts encadenados y las tres reglas que hacen que el mismo personaje salga igual en la escena 1 y en la 6. Central en el ángulo 1; en el 3 cuando una persona se repite. Aquí el personaje actúa y la voz va en off; para que hable a cámara está la Pieza D.
LAS TRES REGLAS DE CONSISTENCIA
1. Una ficha de personaje, escrita una vez, pegada en todos los prompts.
Edad, cabello (color, largo, peinado), piel, ropa exacta (prenda, color, material),
un rasgo distintivo (un lunar, unos lentes, un reloj).
Si cambia una palabra, cambia la persona.
2. La imagen de referencia manda.
La primera escena se genera hasta que el personaje esté bien; esa imagen se adjunta
a todas las siguientes como referencia. El texto describe la acción; la imagen fija la identidad.
3. Una acción y un cambio por escena.
Si cambia el lugar, no cambia la ropa. Si cambia la luz, no cambia el encuadre.
Dos cambios a la vez y el modelo reinventa.
LOS PROMPTS ENCADENADOS
PERSONAJE (se escribe una vez):
«Mujer de 38 años, cabello castaño oscuro recogido en una cola baja, piel clara, camisa azul marino de lino con las mangas dobladas, reloj plateado en la muñeca izquierda, expresión serena.»
ESCENA 1 = PERSONAJE + PLANO + LUZ + ACCIÓN:
«[PERSONAJE]. Plano medio, 35 mm. Luz de ventana lateral, cálida. Está sentada frente a un escritorio de madera, mira una pantalla. Cámara fija.»
→ se genera la imagen hasta que esté bien → se guarda como referencia.
ESCENA 2 = REFERENCIA + PERSONAJE + un cambio:
«[imagen de referencia adjunta] [PERSONAJE]. Mismo plano y luz. Ahora se levanta y camina hacia la ventana. Cámara la sigue lento.»
ESCENA 3 = REFERENCIA + PERSONAJE + un cambio:
«[referencia] [PERSONAJE]. Plano general, 24 mm. Misma ropa. Exterior, calle con árboles, luz de tarde. Camina hacia cámara.»
Pieza D · Actor de IA: cara y movimiento (prompt)
Un presentador que no eres tú (un personaje de marca, un avatar para anuncios) sin actor ni grabación. Dos prompts en orden: la cara para un modelo de imagen y el movimiento para un modelo de animación (escritos para Nano Banana y Wan 2.2 Animate; sirven en cualquier plataforma con esos dos tipos de modelo, y como los minutos gratis cambian seguido aquí no va ningún nombre). Ángulo 1 (variante b) y ángulo 2 (paso 8). Nunca para hablar por ti en tu marca personal: para tu propia cara está la Pieza E.
EL ORDEN
1. LA CARA, con un modelo de imagen: se genera una vez, se corrige hasta que sea la que quieres, y es la referencia de todo lo demás.
2. LA VOZ, antes del movimiento (Pieza G o tu propio audio).
3. EL MOVIMIENTO, con un modelo de animación: la imagen de referencia, el audio, y un video tuyo haciendo el movimiento o su descripción. El modelo mueve la cara de referencia.
EL PROMPT DE LA CARA (modelo de imagen):
Retrato fotográfico, plano medio corto, [edad] años, [rasgos que importan: cabello, piel, expresión neutra], mirando a cámara, luz de ventana lateral suave, fondo liso claro, lente 85 mm, sin maquillaje evidente, sin joyas, piel con textura real. Estilo: fotografía de estudio natural, no ilustración.
EL PROMPT DEL MOVIMIENTO (modelo de animación, con la imagen de la cara y el audio adjuntos):
Anima la imagen de referencia con el movimiento del video adjunto [o: la persona habla a cámara con gestos leves, parpadea de forma irregular cada 3 a 5 segundos, ligero movimiento de hombros]. Mantén la identidad de la cara exacta. Cámara fija. Duración [los segundos que dura el audio adjunto].
LOS TRES ERRORES QUE DELATAN QUE ES IA
1. No parpadea, o parpadea a ritmo fijo. Pide parpadeo irregular cada 3 a 5 segundos.
2. Las manos. Si entran manos, entran mal. Plano medio corto, sin manos.
3. La boca no calza con el audio. La voz se pone primero y el movimiento se genera con el audio
como guía, no al revés.
Pieza E · Tu clon de avatar (paso a paso + prompt)
Para publicar un video tuyo los días que no puedes grabar. El clon habla con tu cara y tu voz a partir de un guion. Ángulo 1, variante c. Corre en cualquier plataforma de avatares: todas piden un video base y un audio. No improvisa ni gesticula con las manos como tú; un personaje que no eres tú es la Pieza D.
LA FICHA DEL VIDEO BASE (se graba una vez)
- Encuadre: plano medio, de la cintura hacia arriba, centrado, mirando a cámara. El de tus reels.
- Luz: la de siempre, frontal y suave. Sin cambios de luz durante la grabación.
- Duración: 3 a 5 minutos hablando con naturalidad, con pausas, gestos normales, parpadeos. Nada de leer: cuenta algo.
- Fondo: el tuyo, fijo. Nada que se mueva atrás.
- Qué no hacer: manos frente a la cara, lentes con reflejo, moverte de sitio, cambiar de ropa, música de fondo.
LA VOZ
Se clona aparte, con 2 a 3 minutos de audio limpio (el mismo video base sirve si el audio es bueno).
Lee un texto con preguntas, afirmaciones y una frase corta: el modelo aprende la entonación de las tres.
LOS CUATRO AJUSTES QUE EVITAN LA BOCA RARA
1. Guion con frases cortas, puntos y comas donde respirarías. El modelo abre y cierra la boca
por puntuación.
2. Velocidad de la voz al 100 por ciento, no acelerada: la aceleración desincroniza.
3. Sin palabras en otro idioma en medio de una frase.
4. Vista previa de los primeros 10 segundos antes de generar el video entero.
EL PROMPT (en la plataforma, con el avatar y la voz ya creados):
Genera el video con mi avatar [nombre del avatar] y mi voz [nombre de la voz]. Guion: [texto con puntuación]. Encuadre igual al video base. Sin música. Duración la que dé el texto. Al final, 1 segundo de silencio mirando a cámara.
CUÁNDO USARLO Y CUÁNDO NO
- Sí: avisos, recordatorios, respuestas a preguntas frecuentes, el mismo video en otro idioma.
- No: tus reels principales, testimonios, nada donde la persona necesite sentir que eres tú en ese momento. La gente lo nota, y lo que pierdes vale más que los minutos que ahorras.
LO QUE CUESTA
Las plataformas cobran por minutos generados al mes. Calcula los tuyos con tu ritmo real (ejemplo asumido: un aviso de 40 segundos cada día son 20 minutos al mes), elige el plan por minutos y no pagues uno anual hasta haber publicado un mes entero con el clon.
Pieza F · Anuncio de producto con IA (prompt)
Un anuncio de producto de 10 segundos sin fotógrafo ni estudio: una foto real del producto, fondo y luz generados, y un movimiento de cámara. Para ecommerce, cosmética, comida, objetos. Central en el ángulo 2. El prompt pide el escenario, no el producto; el copy va encima, escrito por ti.
PASO 1 · LA IMAGEN (modelo de imagen, con la foto real del producto adjunta)
[foto del producto adjunta] Coloca este producto exactamente como está (misma forma, mismos colores, misma etiqueta legible) sobre [superficie: mármol claro / madera / tela de lino], con [luz: ventana lateral suave / dorada de atardecer / estudio con dos fuentes], fondo [desenfocado, tono ___]. Plano [uno de los cinco]. Sin texto agregado, sin elementos extra alrededor.
PASO 2 · LA ANIMACIÓN (modelo de video, con la imagen del paso 1 adjunta)
[imagen del paso 1] Cámara [orbita lento 30 grados / avanza lento / lateral lento]. El producto no cambia. [Un elemento físico: vapor, gotas, una tela que se mueve, partículas de luz]. 6 segundos. Sin cortes.
LOS CINCO ENCUADRES QUE FUNCIONAN PARA PRODUCTO
1. Plano cerrado frontal a la altura del producto, lente 85 mm: la etiqueta legible.
2. Tres cuartos con órbita lenta: se ve la forma.
3. Cenital sobre superficie con dos o tres objetos de contexto: el uso.
4. Plano cerrado a la textura (la crema, la miga, el tejido): el deseo.
5. Producto en mano, plano medio, sin cara: la escala.
La tabla de errores de marca (se revisa en cada imagen, antes de animar):
| Error | Cómo se ve | Qué hacer |
|---|---|---|
| La etiqueta cambia | Letras inventadas, logo deformado | Volver al paso 1 con «etiqueta exactamente como la foto» y comparar lado a lado |
| El color se corre | El envase sale de otro tono | Pedir «mismos colores, sin corrección de color» y ajustar en edición, no en el modelo |
| Proporciones | El producto sale más alto o más ancho | Indicar el tamaño en centímetros y un objeto de referencia (una mano, una taza) |
| Reflejos imposibles | La luz viene de un lado y el reflejo de otro | Una sola fuente de luz en el prompt |
| Texto agregado | Palabras flotando en el fondo | «Sin texto» en cada prompt, y revisar |
Pieza G · Voz en off gratis (paso a paso)
El comando exacto de edge-tts, las cuatro voces latinas que no suenan a robot, la velocidad medida y cómo pegar el audio al video sin desfase. Gratis desde la terminal; en los tres ángulos. Es una voz genérica, no la tuya: para tu voz está la Pieza E.
INSTALACIÓN (una vez, en la terminal)
pip install edge-tts
EL COMANDO (o --file guion.txt en vez de --text)
edge-tts --voice es-CL-CatalinaNeural --rate "+15%" --text "Tu texto aquí, con puntuación." --write-media voz.mp3
LAS CUATRO VOCES QUE NO SUENAN A ROBOT
es-CL-CatalinaNeural: chilena, clara, neutra. Tutoriales, explicaciones.
es-MX-DaliaNeural: mexicana, cálida. Anuncios de producto, historias.
es-CO-SalomeNeural: colombiana, suave. Escenas, voz en off narrativa.
es-AR-ElenaNeural: argentina, con más ritmo. Piezas con energía.
Prueba las cuatro con el mismo párrafo de tu guion antes de elegir: una voz que suena bien en un anuncio suena rara en un tutorial.
LA VELOCIDAD
+15% está medido: al 0 por ciento suena lenta y a lectura; sobre el 20 se atropella en las comas.
Si el guion tiene muchas cifras, baja a +10%.
CÓMO PEGAR EL AUDIO AL VIDEO SIN DESFASE
1. Genera la voz primero y mide su duración en segundos:
ffprobe -v error -show_entries format=duration -of csv=p=0 voz.mp3
2. Corta o alarga el video a esa duración, no al revés: acelerar el audio (atempo) cambia lo que dice y se nota.
Cortar un clip a la duración de su voz (ejemplo: 4.8 segundos):
ffmpeg -i clip.mp4 -t 4.8 -an -c:v libx264 -pix_fmt yuv420p clip_cortado.mp4
Alargarlo congelando el último cuadro (ejemplo: 1.2 segundos más):
ffmpeg -i clip.mp4 -vf "tpad=stop_mode=clone:stop_duration=1.2" -an -c:v libx264 -pix_fmt yuv420p clip_largo.mp4
3. Con varias tomas, la voz se genera y se pega toma por toma: un solo audio largo sobre tomas
concatenadas se corre, porque el audio de cada toma es un poco más corto que su video.
ffmpeg -i clip_cortado.mp4 -i voz.mp3 -c:v copy -map 0:v:0 -map 1:a:0 -shortest toma01.mp4
4. Une las tomas con cortes secos: un lista.txt con una línea por toma (file 'toma01.mp4', ...) y:
ffmpeg -f concat -safe 0 -i lista.txt -c copy final.mp4
SI NO QUIERES TOCAR LA TERMINAL, pega esto en Claude Code (con tus clips y tu guion en una carpeta):
«Instala edge-tts si no está. En esta carpeta hay clips numerados (01.mp4, 02.mp4, ...) y un guion.txt con una frase por línea, en el mismo orden. Para cada línea genera la voz con edge-tts, voz es-CL-CatalinaNeural, rate +15%, como NN.mp3. Mide la duración de cada mp3 con ffprobe, corta o alarga el clip del mismo número a esa duración con ffmpeg (sin acelerar nunca el audio), pégale su audio, y une todas las tomas en orden con cortes secos en final.mp4. Muéstrame la duración de cada toma y la del final antes de terminar.»
Errores conocidos
| Lo que ves | Por qué pasa | Qué haces |
|---|---|---|
| Cada escena trae una persona distinta, o cambió de ropa y de lugar a la vez | La ficha cambió una palabra, faltó la imagen de referencia, o hubo dos cambios en un prompt | Ficha idéntica en todos los prompts, la imagen de la escena 1 adjunta a las siguientes y un cambio por escena (Pieza C) |
| El video no se parece a la imagen que le diste | El prompt de video describió la escena de nuevo y el modelo la reinventó | Al modelo de video se le da la imagen y SOLO el movimiento y la acción (Pieza A, el orden) |
| El clip no dice nada, mezcla dos cosas que se mueven, o salió un clip bueno y nueve malos | El prompt describía una idea, no un plano; dos sujetos en movimiento; un adjetivo de emoción; o se lanzaron diez a la vez | Reescribir con la anatomía de la Pieza A y las reglas del prompt director de la Pieza B, y generar de a uno |
| Manos con seis dedos o derretidas | Las manos generadas entran mal, siempre | Plano medio corto sin manos (Pieza D); producto en mano solo con el encuadre 5 de la Pieza F, revisando cada fotograma |
| El presentador no parpadea o parpadea como metrónomo, o la boca no calza con lo que dice | No se pidió parpadeo irregular, o se generó el movimiento antes que la voz | «Parpadea de forma irregular cada 3 a 5 segundos» en el prompt del movimiento; la voz va primero y el movimiento se genera con el audio como guía (Pieza D) |
| La etiqueta, el color, las proporciones o el reflejo del producto salieron distintos, o hay palabras en el fondo | El modelo redibujó el producto en vez de solo ponerle escenario | Su fila en la tabla de errores de marca de la Pieza F, y comparar con la foto real antes de animar |
| La voz suena lenta y a lectura, se atropella en las comas, o suena a robot | Velocidad al 0 por ciento o sobre el 20; o una voz elegida sin probar | --rate "+15%" (con muchas cifras, +10%) y las cuatro voces de la Pieza G probadas con el mismo párrafo |
| El audio se va corriendo a lo largo del video, o la voz se nota acelerada | Un solo audio largo sobre tomas concatenadas (la diferencia de cada toma se suma); o se aceleró el audio con atempo | Voz por toma, pegada toma por toma, y el video se corta o alarga a la voz, nunca al revés (Pieza G, pasos 2 y 3) |
| Al clon se le ve la boca rara, o se mueve de sitio y cambia la luz | Guion sin puntuación, voz acelerada, una palabra en otro idioma; o un video base con cambios de luz, de sitio o manos frente a la cara | Los cuatro ajustes de la Pieza E con la vista previa de 10 segundos; si es el video base, se vuelve a grabar con su ficha |
Cuando ya lo tienes hecho
Ya tienes un personaje con ficha e imagen de referencia, y ese es el activo: el siguiente video se hace en una hora, porque la ficha, la voz y los planos que funcionaron se reutilizan tal cual. Lo que sigue es un guion nuevo cada semana, y medir qué video trae comentarios y mensajes para hacer más de ese.
Si quieres que lo montemos en tu negocio, escríbeme por WhatsApp y te digo por dónde partir.