Saltar para o conteúdo

UlazAI - Ferramentas de imagem e vídeo de IA

Modelo de retrato falante premium

Gerador de retrato falante OmniHuman 1.5

Transforme um retrato, imagem de personagem ou assunto selecionado em um vídeo falado conduzido por um arquivo de áudio de fala. Este é o caminho a ser usado quando a identidade, a expressão, o timing da boca e o desempenho da parte superior do corpo são mais importantes do que inventar uma cena completa do zero.

27 créditos/s. A saída do Studio está configurada para 1080.

Vídeos de fundadores, explicadores de produtos e clipes localizados de porta-vozes.

Educação liderada por personagens onde o mesmo rosto precisa de vários roteiros.

Animação de retrato onde o movimento da boca, a expressão e o tempo do áudio são importantes.

Criador de IA, avatar e clipes de campanha que precisam de um rosto repetível em muitas mensagens.

Vídeo modelo

Insira, experimente e roteie em um clipe de lançamento

Use isso como uma verificação rápida do modelo antes de gerar: entrada aceita, saída gerada e a rota mais clara no Video Studio.

Entrada Escolha a rota do ativo que você já possui.

Amostra Assista aos clipes gerados antes de gastar créditos.

Rota Limpar prompt, definir preços, definir a próxima etapa.

Por que OmniHuman se adapta ao vídeo falado

OmniHuman é para desempenho de personagens baseado em áudio. A imagem fonte dá identidade; a faixa de fala determina o tempo, o movimento da boca e grande parte da expressão.

Entrada de imagem e áudio

  • A entrada requer um URL de imagem e um URL de áudio de fala.
  • A imagem pode ser JPEG, PNG ou WEBP de até 10 MB.
  • O áudio pode ser nos formatos MP3, WAV, AAC, MP4 ou OGG de até 10 MB.

Duração de áudio recomendada

  • O áudio deve ficar abaixo de 60 segundos.
  • Para uma qualidade facial mais forte, mantenha os clipes por cerca de 15 segundos ou menos.
  • Use um discurso limpo com o roteiro exato; camas de música barulhentas reduzem a confiabilidade.

Máscara e ajudantes de assunto

  • A identificação humana e a detecção de sujeitos são verificações auxiliares, e não modelos de vídeo separados.
  • Use uma máscara quando uma imagem contém várias pessoas ou quando apenas um sujeito deve falar.
  • Uma semente pode ajudar a repetir resultados semelhantes quando a mesma imagem, áudio e prompt são reutilizados.

Controles de qualidade e velocidade

  • A saída pode ser 720p ou 1080p, sendo 1080p usado para a maioria dos clipes de apresentador sofisticados.
  • O modo rápido troca alguma qualidade por uma geração mais rápida.
  • O prompt de comportamento deve ser curto: tom, emoção, postura e movimento natural.

Onde cabe

OmniHuman começa com uma imagem de retrato e áudio de fala. A sincronização labial começa a partir de um vídeo existente e altera o tempo da boca para corresponder ao novo áudio.

Duração 720p/básico 1080p
5s 135 créditos -
10s 270 créditos -
30 anos 810 créditos -
anos 60 1620 créditos -

Casos de uso fortes

Use OmniHuman quando o ativo de marketing for a pessoa ou personagem, não a cena de fundo.

Explicadores porta-vozes

Crie um pequeno clipe do fundador, especialista ou apresentador da marca a partir de um retrato e do roteiro falado exato.

Mensagens de produtos localizadas

Reutilize o mesmo rosto nas faixas de áudio traduzidas, mantendo o clipe focado na fala e na expressão.

Educação liderada por personagens

Crie várias microlições com a mesma imagem de personagem e diferentes faixas de voz limpas.

Campanhas de avatar e criador

Crie clipes repetíveis no estilo do criador, onde a mesma identidade oferece novos ganchos, ofertas ou anúncios.

Rotas de estúdio

Portrait Image to Talking Video

omnihuman_1_5

Estimado a partir do comprimento selecionado; faixa de voz controla o ritmo

Requer um URL de imagem em retrato, um URL de áudio de fala e um breve prompt de comportamento.

Rota aberta

Como isso difere da sincronização labial

OmniHuman começa com uma imagem de retrato e áudio de fala. A sincronização labial começa a partir de um vídeo existente e altera o tempo da boca para corresponder ao novo áudio.

Fluxo de trabalho de produção

  1. Escolha um retrato ou imagem de personagem nítida, com boa visibilidade do rosto e mínima confusão visual.
  2. Se a imagem tiver vários assuntos, faça uma verificação de assunto e use uma máscara para a pessoa que deve falar.
  3. Prepare um áudio de fala limpo com o roteiro final, de preferência 15 segundos ou menos para melhor qualidade.
  4. Escreva um comportamento curto prompt com tom, expressão, postura e movimento natural.
  5. Use 1080p para clipes sofisticados ou modo rápido quando ainda estiver testando scripts.
  6. Reutilize o mesmo estilo de retrato, semente e prompt quando precisar de uma série consistente de apresentadores.

Perguntas frequentes

O que o OmniHuman precisa?

Um URL de imagem de retrato, um URL de áudio de fala e um prompt de expressão ou comportamento.

A ferramenta de detecção auxiliar é um modelo de vídeo?

Não. A rota Studio é a rota de geração de vídeo; auxiliares de detecção são verificações separadas e não são expostos como modelos de vídeo.

Quanto tempo pode durar o áudio?

O áudio deve ser inferior a 60 segundos. Para uma qualidade facial mais forte, mantenha os clipes por cerca de 15 segundos ou menos.

Quais formatos de imagem funcionam?

Use URLs de imagens JPEG, PNG ou WEBP de até 10 MB.

O que a entrada da máscara faz?

Uma máscara ajuda a selecionar um assunto quando a imagem contém várias pessoas ou quando o fundo não deve conduzir a animação.

O que o modo rápido faz?

O modo rápido acelera a geração, mas pode reduzir os detalhes e a qualidade do movimento.

Quanto custa?

A rota custa 27 créditos por segundo de produção.