Přejít k obsahu

UlazAI - AI Image & Video Tools

Prémiový mluvící portrétní model

Generátor mluvících portrétů OmniHuman 1.5

Proměňte portrét, obrázek postavy nebo vybraný předmět na mluvené video řízené zvukovým souborem řeči. Toto je cesta, kterou lze použít, když na identitě, výrazu, načasování úst a výkonu horní části těla záleží více než na vymýšlení celé scény od začátku.

27 kreditů/s. Výstup Studio je nakonfigurován pro 1080.

Videa zakladatelů, vysvětlující informace o produktech a lokalizované klipy mluvčích.

Vzdělávání vedené charakterem, kde stejná tvář potřebuje více scénářů.

Portrétní animace, kde záleží na pohybu úst, výrazu a načasování zvuku.

Tvůrce AI, avatar a klipy kampaní, které potřebují jednu opakovatelnou tvář v mnoha zprávách.

Video modelu

Vstup, vzorek a trasa v jednom spouštěcím klipu

Použijte to jako rychlou kontrolu modelu před generováním: přijatý vstup, generovaný výstup a nejjasnější trasa ve Video Studiu.

Vstup Vyberte trasu z majetku, který již máte.

Ochutnat Než utratíte kredity, podívejte se na vygenerované klipy.

Trasa Jasné prompt, jasné ceny, jasný další krok.

Proč se OmniHuman hodí k mluvícímu videu

OmniHuman je pro výkon postavy řízený zvukem. Zdrojový obrázek dává identitu; řečová stopa řídí načasování, pohyb úst a velkou část výrazu.

Vstup obrazu a zvuku

  • Vstup vyžaduje jednu adresu URL obrázku a jednu adresu URL zvuku řeči.
  • Obrázek může být JPEG, PNG nebo WEBP až do velikosti 10 MB.
  • Zvuk může být ve formátu MP3, WAV, AAC, MP4 nebo OGG až do velikosti 10 MB.

Doporučená délka zvuku

  • Zvuk musí zůstat kratší než 60 sekund.
  • Pro lepší kvalitu obličeje udržujte klipy přibližně 15 sekund nebo kratší.
  • Používejte čistou řeč s přesným písmem; hlučné hudební postele snižují spolehlivost.

Pomocníci masky a předmětu

  • Identifikace člověka a detekce předmětu jsou pomocné kontroly, nikoli samostatné video modely.
  • Použijte masku, když obrázek obsahuje více lidí nebo když má mluvit pouze jeden subjekt.
  • Seed může pomoci zopakovat podobné výsledky, když se znovu použije stejný obrázek, zvuk a prompt.

Kontrola kvality a rychlosti

  • Výstup může být 720p nebo 1080p, přičemž 1080p se používá pro většinu leštěných klipů presenteru.
  • Rychlý režim vyměňuje určitou kvalitu za rychlejší generování.
  • Chování prompt by mělo být krátké: tón, emoce, držení těla a přirozený pohyb.

Kam se to hodí

OmniHuman začíná portrétem a zvukem řeči. Synchronizace rtů začíná od existujícího videa a mění načasování úst tak, aby odpovídalo novému zvuku.

Doba trvání 720p/základ 1080p
5s 135 kredity -
10s 270 kredity -
30. léta 810 kredity -
60. léta 1620 kredity -

Silné případy použití

OmniHuman použijte, když je marketingovým aktivem osoba nebo postava, nikoli scéna na pozadí.

Vysvětlující mluvčí

Vytvořte krátký klip zakladatele, experta nebo představitele značky z jednoho portrétu a přesného mluveného scénáře.

Lokalizované produktové zprávy

Znovu použijte stejnou tvář v přeložených zvukových stopách a zároveň udržujte klip zaměřený na řeč a výraz.

Vzdělávání vedené charakterem

Sestavte více mikrolekcí se stejným obrazem postavy a různými čistými hlasovými stopami.

Kampaně avatarů a tvůrců

Vytvářejte opakovatelné klipy ve stylu tvůrců, kde stejná identita přináší nové háčky, nabídky nebo oznámení.

Studiové cesty

Portrait Image to Talking Video

omnihuman_1_5

Odhadem z vybrané délky; hlasová stopa ovládá tempo

Vyžaduje jednu adresu URL obrázku na výšku, jednu adresu URL zvuku řeči a krátké chování prompt.

Otevřená trasa

Jak se liší od synchronizace rtů

OmniHuman začíná portrétem a zvukem řeči. Synchronizace rtů začíná od existujícího videa a mění načasování úst tak, aby odpovídalo novému zvuku.

Výrobní pracovní postup

  1. Vyberte si jasný portrét nebo obrázek postavy s dobrou viditelností obličeje a minimálním vizuálním nepořádkem.
  2. Pokud má obrázek několik předmětů, spusťte kontrolu předmětu a použijte masku pro osobu, která by měla mluvit.
  3. Připravte čistý zvuk řeči s konečným scénářem, nejlépe 15 sekund nebo kratší pro nejlepší kvalitu.
  4. Napište krátké chování prompt s tónem, výrazem, držením těla a přirozeným pohybem.
  5. Použijte 1080p pro vylepšené klipy nebo rychlý režim, když skripty stále testujete.
  6. Znovu použijte stejný portrét, semeno a styl prompt, když potřebujete konzistentní řadu přednášejících.

FAQ

Co OmniHuman potřebuje?

Jedna adresa URL obrázku na výšku, jedna adresa URL zvuku řeči a prompt pro výraz nebo chování.

Je nástroj pro detekci pomocníka video modelem?

Ne. Cesta Studio je cesta pro generování videa; pomocníci detekce jsou samostatné kontroly a nejsou vystaveny jako video modely.

Jak dlouhý může být zvuk?

Zvuk musí být kratší než 60 sekund. Pro lepší kvalitu obličeje udržujte klipy přibližně 15 sekund nebo kratší.

Které obrazové formáty fungují?

Použijte adresy URL obrázků JPEG, PNG nebo WEBP do velikosti 10 MB.

Co dělá vstup masky?

Maska pomáhá vybrat jeden předmět, když obrázek obsahuje více lidí nebo když pozadí nemá řídit animaci.

Co dělá rychlý režim?

Rychlý režim urychluje generování, ale může snížit kvalitu detailů a pohybu.

co to stojí?

Trasa stojí 27 kreditů za výstupní sekundu.