Przejdź do treści

UlazAI – narzędzia do tworzenia obrazów i wideo AI

Mówiący model portretowy premium

Generator mówiącego portretu OmniHuman 1.5

Zamień portret, obraz postaci lub wybrany obiekt w mówiący film oparty na pliku dźwiękowym mowy. Tę metodę można zastosować, gdy tożsamość, ekspresja, wyczucie czasu i wydajność górnej części ciała mają większe znaczenie niż wymyślanie całej sceny od zera.

27 kredytów/s. Wyjście studyjne jest skonfigurowane na 1080.

Filmy założycieli, objaśnienia produktów i zlokalizowane klipy z rzecznikami.

Edukacja oparta na postaciach, w której ta sama twarz wymaga wielu scenariuszy.

Animacja portretowa, w której liczy się ruch ust, ekspresja i synchronizacja dźwięku.

Twórca AI, awatar i klipy kampanii, które wymagają jednej powtarzalnej twarzy w wielu wiadomościach.

Modelowe wideo

Wejście, próbka i trasa w jednym klipie startowym

Użyj tego do szybkiego sprawdzenia modelu przed wygenerowaniem: zaakceptowanych danych wejściowych, wygenerowanych danych wyjściowych i najczystszej trasy w Video Studio.

Wejście Wybierz trasę z zasobu, który już posiadasz.

Próbka Oglądaj wygenerowane klipy, zanim wydasz kredyty.

Trasa Jasne prompt, jasne ceny, jasny następny krok.

Dlaczego OmniHuman pasuje do rozmów wideo

OmniHuman służy do odtwarzania postaci sterowanej dźwiękiem. Obraz źródłowy nadaje tożsamość; ścieżka mowy wpływa na synchronizację, ruch ust i większą część ekspresji.

Wejście obrazu i dźwięku

  • Dane wejściowe wymagają jednego adresu URL obrazu i jednego adresu URL dźwięku mowy.
  • Obraz może mieć format JPEG, PNG lub WEBP o rozmiarze do 10 MB.
  • Dźwięk może być w formacie MP3, WAV, AAC, MP4 lub OGG do 10 MB.

Zalecana długość dźwięku

  • Dźwięk musi trwać poniżej 60 sekund.
  • Aby uzyskać lepszą jakość twarzy, klipy powinny trwać około 15 sekund lub krócej.
  • Używaj czystej mowy z dokładnym pismem; hałaśliwe łóżka muzyczne zmniejszają niezawodność.

Maska i pomocnicy podmiotu

  • Identyfikacja człowieka i wykrywanie obiektu to kontrole pomocnicze, a nie oddzielne modele wideo.
  • Użyj maski, jeśli obraz przedstawia wiele osób lub gdy powinien przemawiać tylko jeden podmiot.
  • Zalążek może pomóc w powtórzeniu podobnych wyników w przypadku ponownego wykorzystania tego samego obrazu, dźwięku i prompt.

Kontrola jakości i szybkości

  • Wyjście może mieć rozdzielczość 720p lub 1080p, przy czym 1080p jest używane w większości dopracowanych klipów prezentera.
  • Tryb szybki rezygnuje z jakości na rzecz szybszego generowania.
  • Zachowanie prompt powinno być krótkie: ton, emocje, postawa i naturalny ruch.

Gdzie to pasuje

OmniHuman zaczyna od obrazu portretowego i dźwięku mowy. Synchronizacja ust rozpoczyna się od istniejącego wideo i zmienia synchronizację ust, aby dopasować ją do nowego dźwięku.

Czas trwania 720p / baza 1080p
5s 135 kredyty -
10 s 270 kredyty -
lata 30 810 kredyty -
lata 60 1620 kredyty -

Mocne przypadki użycia

Użyj OmniHuman, gdy aktywem marketingowym jest osoba lub postać, a nie scena w tle.

Wyjaśnienia rzecznika

Utwórz krótki klip założyciela, eksperta lub prezentera marki na podstawie jednego portretu i dokładnie mówionego scenariusza.

Zlokalizowane komunikaty dotyczące produktów

Wykorzystaj ponownie tę samą twarz w przetłumaczonych ścieżkach audio, skupiając klip na mowie i ekspresji.

Edukacja oparta na charakterze

Twórz wiele mikrolekcji z tym samym obrazem postaci i różnymi czystymi ścieżkami głosowymi.

Kampanie awatarów i twórców

Twórz powtarzalne klipy w stylu twórcy, w których ta sama tożsamość dostarcza nowych haczyków, ofert lub ogłoszeń.

Trasy studyjne

Portrait Image to Talking Video

omnihuman_1_5

Szacowany na podstawie wybranej długości; ścieżka głosowa steruje tempem

Wymaga jednego adresu URL obrazu portretowego, jednego adresu URL dźwięku mowy i krótkiego zachowania prompt.

Otwarta trasa

Czym to się różni od synchronizacji warg

OmniHuman zaczyna od obrazu portretowego i dźwięku mowy. Synchronizacja ust rozpoczyna się od istniejącego wideo i zmienia synchronizację ust, aby dopasować ją do nowego dźwięku.

Przepływ pracy w produkcji

  1. Wybierz wyraźny portret lub obraz postaci z dobrą widocznością twarzy i minimalnym bałaganem wizualnym.
  2. Jeśli obraz ma kilka tematów, sprawdź temat i użyj maski dla osoby, która powinna mówić.
  3. Przygotuj czysty dźwięk mowy z ostatecznym scenariuszem, najlepiej 15 sekund lub krócej, aby uzyskać najlepszą jakość.
  4. Napisz krótkie zachowanie prompt z tonem, ekspresją, postawą i naturalnym ruchem.
  5. Użyj 1080p do dopracowanych klipów lub trybu szybkiego, gdy nadal testujesz skrypty.
  6. Jeśli potrzebujesz spójnej serii prezenterów, użyj ponownie tego samego portretu, materiału siewnego i stylu prompt.

Często zadawane pytania

Czego potrzebuje OmniHuman?

Jeden adres URL obrazu portretowego, jeden adres URL dźwięku mowy i prompt do wyrażenia lub zachowania.

Czy narzędzie do wykrywania pomocniczego jest modelem wideo?

Nie. Trasa Studio to trasa generowania wideo; pomocnicy wykrywania są oddzielnymi kontrolami i nie są ujawniane jako modele wideo.

Jak długi może być dźwięk?

Dźwięk musi być krótszy niż 60 sekund. Aby uzyskać lepszą jakość twarzy, klipy powinny trwać około 15 sekund lub krócej.

Jakie formaty obrazów działają?

Użyj adresów URL obrazów JPEG, PNG lub WEBP o rozmiarze do 10 MB.

Do czego służy wejście maski?

Maska pomaga wybrać jeden obiekt, gdy obraz zawiera wiele osób lub gdy tło nie powinno napędzać animacji.

Co robi tryb szybki?

Tryb szybki przyspiesza generowanie, ale może zmniejszyć szczegółowość i jakość ruchu.

Ile to kosztuje?

Trasa kosztuje 27 kredytów za sekundę wyjściową.