Saltar al contenido

UlazAI - Herramientas de imagen y vídeo de IA

Modelo de retrato parlante premium

Generador de retratos parlantes OmniHuman 1.5

Convierta un retrato, una imagen de un personaje o un sujeto seleccionado en un video hablado impulsado por un archivo de audio de voz. Esta es la ruta a seguir cuando la identidad, la expresión, el ritmo de la boca y el desempeño de la parte superior del cuerpo importan más que inventar una escena completa desde cero.

27 créditos/s. La salida de estudio está configurada para 1080.

Vídeos de fundadores, explicaciones de productos y clips de portavoces localizados.

Educación basada en el carácter donde un mismo rostro necesita múltiples guiones.

Animación de retratos donde el movimiento de la boca, la expresión y la sincronización del audio son importantes.

Creador de IA, avatar y clips de campaña que necesitan una cara repetible en muchos mensajes.

Vídeo modelo

Entrada, muestreo y ruta en un clip de lanzamiento

Utilice esto como verificación rápida del modelo antes de generar: entrada aceptada, salida generada y la ruta más clara en Video Studio.

Aporte Elija la ruta del activo que ya tiene.

Muestra Mire los clips generados antes de gastar créditos.

Ruta Borrar prompt, precios claros, siguiente paso claro.

Por qué OmniHuman se adapta al vídeo parlante

OmniHuman es para la interpretación de personajes basada en audio. La imagen fuente da identidad; la pista del habla impulsa el tiempo, el movimiento de la boca y gran parte de la expresión.

Entrada de imagen y audio

  • La entrada requiere una URL de imagen y una URL de audio de voz.
  • La imagen puede ser JPEG, PNG o WEBP hasta 10MB.
  • El audio puede ser formatos de estilo MP3, WAV, AAC, MP4 u OGG de hasta 10 MB.

Duración de audio recomendada

  • El audio debe permanecer por debajo de los 60 segundos.
  • Para una calidad facial más fuerte, mantenga los clips de alrededor de 15 segundos o menos.
  • Utilice un discurso limpio con el guión exacto; Las camas musicales ruidosas reducen la confiabilidad.

Ayudantes de máscara y sujeto.

  • La identificación humana y la detección de sujetos son comprobaciones auxiliares, no modelos de vídeo separados.
  • Utilice una máscara cuando una imagen contenga varias personas o cuando solo un sujeto deba hablar.
  • Una semilla puede ayudar a repetir resultados similares cuando se reutilizan la misma imagen, audio y prompt.

Controles de calidad y velocidad.

  • La salida puede ser de 720p o 1080p, y se utiliza 1080p para la mayoría de los clips de presentador pulidos.
  • El modo rápido cambia algo de calidad por una generación más rápida.
  • El comportamiento prompt debe ser breve: tono, emoción, postura y movimiento natural.

donde encaja

OmniHuman comienza a partir de una imagen vertical y un audio de voz. La sincronización de labios comienza a partir de un vídeo existente y cambia el tiempo de la boca para que coincida con el nuevo audio.

Duración 720p/base 1080p
5s 135 créditos -
10 270 créditos -
30 años 810 créditos -
años 60 1620 créditos -

Casos de uso sólidos

Utilice OmniHuman cuando el activo de marketing sea la persona o el personaje, no la escena de fondo.

Explicadores del portavoz

Cree un breve clip de fundador, experto o presentador de marca a partir de un retrato y el guión hablado exacto.

Mensajes de productos localizados

Reutilice la misma cara en las pistas de audio traducidas manteniendo el clip centrado en el habla y la expresión.

Educación basada en el carácter

Crea múltiples microlecciones con la misma imagen de personaje y diferentes pistas de voz limpias.

Campañas de avatar y creador.

Cree clips repetibles al estilo de los creadores donde la misma identidad ofrezca nuevos ganchos, ofertas o anuncios.

Rutas de estudio

Portrait Image to Talking Video

omnihuman_1_5

Estimado a partir de la longitud seleccionada; La pista de voz controla el ritmo.

Requiere una URL de imagen vertical, una URL de audio de voz y un comportamiento breve prompt.

Ruta abierta

En qué se diferencia de la sincronización de labios

OmniHuman comienza a partir de una imagen vertical y un audio de voz. La sincronización de labios comienza a partir de un vídeo existente y cambia el tiempo de la boca para que coincida con el nuevo audio.

Flujo de trabajo de producción

  1. Elija un retrato claro o una imagen de personaje con buena visibilidad del rostro y un desorden visual mínimo.
  2. Si la imagen tiene varios sujetos, realice una verificación de sujetos y use una máscara para la persona que debe hablar.
  3. Prepare un audio de voz limpio con el guión final, preferiblemente de 15 segundos o menos para obtener la mejor calidad.
  4. Escribe un comportamiento breve prompt con tono, expresión, postura y movimiento natural.
  5. Utilice 1080p para clips pulidos o el modo rápido cuando todavía esté probando guiones.
  6. Reutilice el mismo estilo vertical, semilla y prompt cuando necesite una serie de presentadores consistentes.

Preguntas frecuentes

¿Qué necesita OmniHuman?

Una URL de imagen vertical, una URL de audio de voz y un prompt para expresión o comportamiento.

¿La herramienta de detección auxiliar es un modelo de vídeo?

No. La ruta Studio es la ruta de generación de video; Los ayudantes de detección son comprobaciones independientes y no se exponen como modelos de vídeo.

¿Cuánto tiempo puede durar el audio?

El audio debe ser inferior a 60 segundos. Para una calidad facial más fuerte, mantenga los clips de alrededor de 15 segundos o menos.

¿Qué formatos de imagen funcionan?

Utilice URL de imágenes JPEG, PNG o WEBP de hasta 10 MB.

¿Qué hace la entrada de máscara?

Una máscara ayuda a seleccionar un sujeto cuando la imagen contiene varias personas o cuando el fondo no debe impulsar la animación.

¿Qué hace el modo rápido?

El modo rápido acelera la generación pero puede reducir los detalles y la calidad del movimiento.

¿Cuánto cuesta?

La ruta cuesta 27 créditos por segundo de salida.