Voz y subtítulos
Cuando tu proyecto ya tiene escenas con diálogo, esta pantalla decide cómo suena y qué se lee. Está en
Proyectos → tu proyecto → Voz y subtítulos (/proyectos/<id>/voz). Solo la ve el dueño del proyecto.
Los dos modos de voz
Se elige uno para todo el proyecto, y son excluyentes:
| Modo | Quién pone la voz | Qué cuesta | Subtítulos |
|---|---|---|---|
| Voz del clip (de fábrica) | El propio modelo de vídeo, con los labios sincronizados | Nada más de lo que ya cuesta el clip | Se sacan transcribiendo el audio del clip |
| Pista de voz aparte | Un modelo de voz, escena a escena | Una llamada de voz por escena | Salen del diálogo y se ajustan con los tiempos del audio |
En modo «pista», los clips se piden sin diálogo, solo con sonido ambiente: si el clip también lo dijera, se oirían dos voces distintas diciendo lo mismo.
Quitar la voz que trae el clip
Aparte del modo, cada escena con clip producido tiene su interruptor «Quitar el audio del clip», en el paso Escenas del proyecto (bloque «Clips ya producidos»). Con él encendido, esa escena entra en el montaje y en el MP4 sin el sonido del clip: ni su voz ni su ambiente. No toca el archivo, no cuesta nada y se puede deshacer.
Es por escena y no cambia el modo del proyecto:
- en voz del clip, la escena queda sin voz (con la música, si la hay);
- en pista de voz aparte, se oye solo su pista de voz, sin la voz que el clip traía dentro. Es la forma de ponerle voz en off a un clip que ya habla sin volver a producirlo: quítale el audio y genera su pista.
Lo que se subtitula es lo que se oye: una escena con el audio del clip quitado y sin pista de voz aparte no se transcribe ni lleva subtítulos en el fichero ni en el MP4, y su tarjeta lo dice («Sin subtítulos: el audio está quitado»). Con pista de voz aparte, sus subtítulos salen del diálogo como siempre.
La tarjeta de cada clip dice en una frase qué se va a oír, y avisa si se oirían dos voces diciendo lo mismo. Es lo que usa un clip traído de Crear (De Crear a un proyecto).
Por qué la voz no se elige escena a escena
Porque es lo único que hace que el timbre no cambie de plano a plano. Dos clips generados por separado pueden salir con voces distintas aunque el personaje sea el mismo, y un vídeo así no se puede publicar. La voz y sus mandos (estabilidad, fidelidad al timbre, estilo y velocidad) se fijan una vez, para el proyecto entero, y todas sus escenas se generan con ellos.
Si lo intentas desde otra pantalla o con una herramienta propia, el servidor lo rechaza y te dice por qué.
Quién genera la voz, y por qué puede cambiar
Escenara puede tener dos proveedores de voz: el principal de la instalación y uno de reserva, cada uno con tu propia clave. El panel de la voz te dice con cuál se va a generar y con cuál se cambiaría.
El cambio es automático y no te pregunta, pero solo ocurre en un caso muy concreto: cuando el primero rechaza la petición de forma que demuestra que no ha cobrado nada (tu clave no vale allí, esa cuenta no tiene saldo, te ha pedido esperar). Entonces se prueba con el otro y, si sale, te lo dice: verás en la escena con qué proveedor se generó y en qué cuenta se ha pagado.
Si el primero falla de una forma que no prueba que no haya cobrado (una avería suya, un corte de red, una respuesta que no se entiende), no se cambia y no se reenvía nada: podrías acabar pagando dos veces. El mensaje te lo dice con esas palabras y te pide que mires el historial de esa cuenta antes de volver a pedirlo.
Como el cambio no te pregunta, cada escena te enseña lo que costaría en los dos, cada uno en sus propios créditos (los de un proveedor no valen lo mismo que los del otro, así que no se suman ni se comparan). La voz se cobra por carácter, así que la cifra depende de lo largo que sea el diálogo. El cambio solo se hace al proveedor y modelo que viste al pedirlo y solo si lo que cuesta allí cabe en lo que viste; si no (por ejemplo, porque añadiste la clave del otro después de pedir la voz), no se cambia y se te dice por qué. Lo que se apunta como gastado es lo que informe el proveedor que de verdad haya cobrado, no la estimación.
Si solo tienes la clave de uno, no hay cambio posible: si falla, se te dice y se te recuerda que puedes añadir la del otro en «Tu cuenta» para que el siguiente intento lo pruebe solo.
Oír una voz antes de elegirla
Cada voz tiene su muestra. La primera vez cuesta una llamada, y la pantalla te dice cuánto antes de pedirla. A partir de ahí es tuya: volver a oírla no cuesta nada, ni hoy ni la próxima vez que abras el selector. Si cambias un mando (por ejemplo, la estabilidad), esa combinación es otra muestra, porque suena distinto.
Cambiar la voz: qué pasa con lo ya generado
Cambiar el modo, la voz, uno de sus mandos o el diálogo de una escena deja sin valer el audio y los subtítulos que dependían de ello. Cuando eso ocurre:
- no se borra nada. El audio que pagaste sigue en tu biblioteca;
- no se regenera nada solo. Nunca se gasta sin que lo confirmes;
- si el cambio deja sin valer escenas ya generadas, la pantalla te dice cuántas son y te pide confirmarlo antes de aplicarlo;
- si pasas a «pista de voz aparte» y ya tienes clips producidos con el diálogo hablado dentro, también te lo dice: si les añades la pista sin volver a producir el clip ni quitarle su audio, se oirían dos voces diciendo lo mismo. Las escenas con el audio del clip quitado no cuentan para este aviso;
- corregir los subtítulos de una escena no la da por buena: mientras lo que se oye siga sin corresponder a lo que dice ahora (su pista de voz o el audio de su clip), la pantalla te la sigue señalando;
- después, regeneras las que quieras una a una, confirmando el coste de cada una.
Subtítulos
Hay tres formas de llenarlos, y todas dejan un punto de partida que tú corriges:
- Las marcas del propio proveedor de voz, cuando la pista se genera con un proveedor que las devuelve: son los tiempos medidos sobre el audio que acaba de crear, así que llegan solas y no cuestan nada aparte.
- Transcribir el audio (la pista de voz, o el clip si estás en modo «voz del clip»). Los tiempos son los medidos. Transcribir no cuesta nada: se hace en la propia máquina y no sale nada de ella. Si tu instalación no tiene el transcriptor instalado, la pantalla lo dice: no se inventan subtítulos.
- Proponer desde el diálogo, cuando aún no hay audio. Reparte el tiempo de la escena en proporción a lo que ocupa cada frase. Es una propuesta, no una medición: habrá que ajustarla.
- Escribirlos a mano, añadiendo líneas con sus tiempos.
Transcribir y proponer sustituyen los subtítulos por completo. Si los que hay los has corregido tú, Escenara te lo dice y te pide confirmarlo antes: lo que editas no se guarda en ningún otro sitio.
En el editor puedes cambiar el texto, los tiempos y dónde se parte cada línea. A la derecha ves el subtítulo sobre el clip, con las zonas que la aplicación de destino tapa en vertical dibujadas: lo de arriba, su interfaz; lo de abajo, sus botones y su pie de texto. Un subtítulo colocado ahí no lo va a leer nadie.
Escenara avisa cuando una línea es muy larga, cuando hay más de dos líneas o cuando un subtítulo pasa demasiado rápido para leerlo, pero no te lo impide: tú sabrás. Lo que sí rechaza son los tiempos imposibles (un subtítulo que acaba antes de empezar o que se solapa con el anterior), porque eso no se puede exportar.
Descargar los subtítulos
Los botones Descargar SRT y Descargar WebVTT generan el fichero del proyecto entero, con los tiempos corridos escena a escena en el orden en que se montará el vídeo.
Lo que se exporta son los subtítulos que has guardado, nunca la transcripción en bruto: lo que se publica es lo que una persona ha corregido.
Música de fondo
La música se sube, no se genera. Para añadir una pista tienes que declarar por escrito con qué derecho la usas: de quién es, con qué licencia o dónde la compraste. Sin esa declaración no se añade, y lo impide el servidor, no el formulario. Queda guardada con su fecha, para poder responder si alguien lo pregunta.
Cada pista tiene su volumen, que es con el que entrará en la mezcla final. Quitarla del proyecto no borra el archivo de tu biblioteca.
Si no puedes generar la voz
La pantalla siempre dice el motivo en lugar de esconder el botón. Los habituales:
- «Esta instalación no ofrece la pista de voz aparte.» Quien administra la enciende en Admin › Ajustes › Voz y subtítulos.
- «No hay precio registrado.» El modelo de voz está en el catálogo pero nadie ha medido su coste todavía. Sin precio no se estima y no se gasta: quien administra tiene que medirlo una vez y registrarlo en Admin › Modelos.
- «Elige la voz del proyecto antes de generar.» Estás en modo «pista» y aún no has fijado ninguna.
- «Esta escena no tiene diálogo.» No hay nada que leer: escribe lo que dice en el plan del proyecto.
Los mensajes de error de la voz siempre dicen cuatro cosas: qué proveedor y qué modelo han fallado y por qué (tiempo agotado, avería suya, clave rechazada, sin saldo…), si se te ha cobrado o no, qué se intentó después y qué puedes hacer tú. Si alguna vez lees un «no se ha podido, vuelve a intentarlo», es un fallo nuestro: cuéntalo.
Si la generación de la voz de una escena falla, la tarjeta de esa escena te lo dice. Es un fallo de la voz: su clip sigue estando bien producido y la pantalla de producción no la marca como fallida.