Passer au contenu

UlazAI - Outils d'image et de vidéo IA

Modèle de portrait parlant premium

Générateur de portraits parlants OmniHuman 1.5

Transformez un portrait, une image de personnage ou un sujet sélectionné en une vidéo parlante pilotée par un fichier audio vocal. C’est la voie à suivre lorsque l’identité, l’expression, le timing de la bouche et la performance du haut du corps comptent plus que l’invention d’une scène complète à partir de zéro.

Pour comparer les coûts avant de générer, consultez les tarifs de Veo 3.

27 crédits/s. La sortie Studio est configurée pour 1080.

Vidéos des fondateurs, explications de produits et clips localisés des porte-parole.

Une éducation axée sur les personnages où le même visage nécessite plusieurs scripts.

Animation de portrait où le mouvement de la bouche, l'expression et le timing audio sont importants.

Créateur d'IA, avatars et clips de campagne nécessitant un visage reproductible dans de nombreux messages.

Vidéo du modèle

Entrée, échantillon et itinéraire dans un seul clip de lancement

Utilisez-le comme vérification rapide du modèle avant de générer : entrée acceptée, sortie générée et itinéraire le plus clair dans Video Studio.

Saisir Choisissez l'itinéraire parmi l'actif que vous possédez déjà.

Échantillon Regardez les clips générés avant de dépenser des crédits.

Itinéraire Effacer prompt, clarifier les prix, effacer la prochaine étape.

Pourquoi OmniHuman convient à la vidéo parlante

OmniHuman est destiné aux performances de personnages pilotées par l'audio. L'image source donne l'identité ; la piste vocale détermine le timing, le mouvement de la bouche et une grande partie de l'expression.

Entrée image et audio

  • La saisie nécessite une URL d’image et une URL audio vocale.
  • L'image peut être au format JPEG, PNG ou WEBP jusqu'à 10 Mo.
  • L'audio peut être au format MP3, WAV, AAC, MP4 ou OGG jusqu'à 10 Mo.

Durée audio recommandée

  • L'audio doit rester inférieur à 60 secondes.
  • Pour une meilleure qualité du visage, conservez les clips pendant environ 15 secondes ou moins.
  • Utilisez un discours clair avec le script exact ; les lits musicaux bruyants réduisent la fiabilité.

Aides aux masques et aux sujets

  • L'identification humaine et la détection du sujet sont des vérifications auxiliaires et non des modèles vidéo distincts.
  • Utilisez un masque lorsqu'une image contient plusieurs personnes ou lorsqu'un seul sujet doit parler.
  • Une graine peut aider à répéter des résultats similaires lorsque la même image, le même audio et le prompt sont réutilisés.

Contrôles de qualité et de rapidité

  • La sortie peut être 720p ou 1080p, 1080p étant utilisé pour la plupart des clips de présentateur raffinés.
  • Le mode rapide échange une certaine qualité contre une génération plus rapide.
  • Le comportement prompt doit être court : ton, émotion, posture et mouvement naturel.

Où ça correspond

OmniHuman part d'une image de portrait et d'un son vocal. La synchronisation labiale démarre à partir d'une vidéo existante et modifie le timing de la bouche pour correspondre au nouvel audio.

Durée 720p / base 1080p
5s 135 crédits -
10s 270 crédits -
années 30 810 crédits -
années 60 1620 crédits -

Cas d'utilisation forts

Utilisez OmniHuman lorsque l'actif marketing est la personne ou le personnage, et non la scène d'arrière-plan.

Explications du porte-parole

Créez un court clip de fondateur, d'expert ou de présentateur de marque à partir d'un portrait et du script parlé exact.

Messages de produits localisés

Réutilisez le même visage sur les pistes audio traduites tout en gardant le clip concentré sur la parole et l’expression.

Éducation axée sur le caractère

Créez plusieurs micro-leçons avec la même image de personnage et différentes pistes vocales claires.

Campagnes d'avatar et de créateur

Créez des clips reproductibles de style créateur où la même identité propose de nouvelles accroches, offres ou annonces.

Itinéraires en studio

Portrait Image to Talking Video

omnihuman_1_5

Estimé à partir de la longueur sélectionnée ; la piste vocale contrôle le rythme

Nécessite une URL d'image de portrait, une URL d'audio vocal et un court comportement prompt.

Itinéraire ouvert

En quoi cela diffère de la synchronisation labiale

OmniHuman part d'une image de portrait et d'un son vocal. La synchronisation labiale démarre à partir d'une vidéo existante et modifie le timing de la bouche pour correspondre au nouvel audio.

Flux de travail de production

  1. Choisissez un portrait ou une image de personnage clair avec une bonne visibilité du visage et un encombrement visuel minimal.
  2. Si l'image comporte plusieurs sujets, effectuez une vérification du sujet et utilisez un masque pour la personne qui doit parler.
  3. Préparez un son vocal clair avec le script final, de préférence 15 secondes ou moins pour une meilleure qualité.
  4. Écrivez un court comportement prompt avec ton, expression, posture et mouvement naturel.
  5. Utilisez 1080p pour des clips soignés ou le mode rapide lorsque vous testez encore des scripts.
  6. Réutilisez les mêmes styles portrait, graine et prompt lorsque vous avez besoin d'une série de présentateurs cohérente.

FAQ

De quoi OmniHuman a-t-il besoin ?

Une URL d'image de portrait, une URL d'audio vocal et un prompt pour l'expression ou le comportement.

L’outil de détection d’assistance est-il un modèle vidéo ?

Non. La route Studio est la route de génération vidéo ; les aides à la détection sont des contrôles distincts et ne sont pas exposés en tant que modèles vidéo.

Combien de temps l'audio peut-il durer ?

L'audio doit être inférieur à 60 secondes. Pour une meilleure qualité du visage, conservez les clips pendant environ 15 secondes ou moins.

Quels formats d'images fonctionnent ?

Utilisez des URL d'images JPEG, PNG ou WEBP jusqu'à 10 Mo.

À quoi sert la saisie du masque ?

Un masque permet de sélectionner un sujet lorsque l'image contient plusieurs personnes ou lorsque l'arrière-plan ne doit pas piloter l'animation.

A quoi sert le mode rapide ?

Le mode rapide accélère la génération mais peut réduire les détails et la qualité du mouvement.

Qu'est-ce que ça coûte ?

L'itinéraire coûte 27 crédits par seconde de sortie.

OmniHuman 1.5 : jugez d’abord le visage et le rythme de parole

Utilisez un portrait net et un extrait audio court pour évaluer la synchronisation, les micro-expressions et la stabilité du visage. Une longue vidéo masque souvent les erreurs jusqu’au moment du montage.

Vérifiez que vous avez l’autorisation d’utiliser l’image et la voix. N’imitez pas une personne réelle à des fins trompeuses ou sans son accord.