تخطَّ إلى المحتوى

UlazAI - أدوات الصور والفيديو بالذكاء الاصطناعي

نموذج بورتريه ناطق متميز

OmniHuman 1.5 مولد صورة يتحدث

قم بتحويل صورة شخصية أو صورة شخصية أو موضوع محدد إلى فيديو ناطق يتم تشغيله بواسطة ملف صوتي للكلام. هذا هو الطريق الذي يجب استخدامه عندما تكون الهوية والتعبير وتوقيت الفم وأداء الجزء العلوي من الجسم أكثر أهمية من اختراع مشهد كامل من الصفر.

27 اعتماد / ثانية. تم تكوين إخراج الاستوديو لـ 1080.

مقاطع فيديو المؤسس، وشرح المنتج، ومقاطع المتحدث الرسمي المحلية.

التعليم الذي تقوده الشخصية حيث يحتاج الوجه نفسه إلى نصوص متعددة.

الرسوم المتحركة الشخصية حيث تكون حركة الفم والتعبير وتوقيت الصوت مهمة.

منشئ الذكاء الاصطناعي والصورة الرمزية ومقاطع الحملة التي تحتاج إلى وجه واحد قابل للتكرار عبر العديد من الرسائل.

فيديو نموذجي

الإدخال والعينة والتوجيه في مقطع إطلاق واحد

استخدم هذا كفحص سريع للنموذج قبل الإنشاء: المدخلات المقبولة والمخرجات التي تم إنشاؤها والمسار الأوضح في Video Studio.

مدخل اختر المسار من الأصل الذي لديك بالفعل.

عينة شاهد المقاطع التي تم إنشاؤها قبل إنفاق الاعتمادات.

طريق امسح prompt، وحدد الأسعار، وامسح الخطوة التالية.

لماذا يناسب OmniHuman الفيديو الحديث

OmniHuman مخصص لأداء الشخصية المعتمد على الصوت. الصورة المصدر تعطي الهوية. يحرك مسار الكلام التوقيت وحركة الفم والكثير من التعبير.

إدخال الصورة والصوت

  • يتطلب الإدخال عنوان URL واحدًا للصورة وعنوان URL صوتيًا واحدًا للكلام.
  • يمكن أن تكون الصورة JPEG أو PNG أو WEBP بحجم يصل إلى 10 ميجابايت.
  • يمكن أن يكون الصوت بتنسيقات MP3 أو WAV أو AAC أو MP4 أو OGG بحجم يصل إلى 10 ميجابايت.

طول الصوت الموصى به

  • يجب أن يبقى الصوت أقل من 60 ثانية.
  • للحصول على جودة أقوى للوجه، احتفظ بالمقاطع لمدة 15 ثانية تقريبًا أو أقل.
  • استخدم خطابًا نظيفًا مع النص الدقيق؛ أسرة الموسيقى الصاخبة تقلل من الموثوقية.

قناع ومساعدين الموضوع

  • يعد تحديد هوية الإنسان واكتشاف الهدف بمثابة عمليات فحص مساعدة، وليست نماذج فيديو منفصلة.
  • استخدم قناعًا عندما تحتوي الصورة على عدة أشخاص أو عندما يجب أن يتحدث موضوع واحد فقط.
  • يمكن أن تساعد البذرة في تكرار نتائج مماثلة عند إعادة استخدام نفس الصورة والصوت وprompt.

ضوابط الجودة والسرعة

  • يمكن أن يكون الإخراج 720 بكسل أو 1080 بكسل، مع استخدام 1080 بكسل لمعظم مقاطع مقدم العرض المصقولة.
  • يستبدل الوضع السريع بعض الجودة لتوليد أسرع.
  • يجب أن يكون السلوك prompt قصيرًا: النغمة والعاطفة والوضعية والحركة الطبيعية.

حيث يناسب

يبدأ OmniHuman من صورة شخصية وصوت الكلام. تبدأ مزامنة الشفاه من مقطع فيديو موجود وتغير توقيت الفم ليتوافق مع الصوت الجديد.

المدة 720p / قاعدة 1080p
5s 135 الاعتمادات -
10 ثانية 270 الاعتمادات -
30 ثانية 810 الاعتمادات -
الستينيات 1620 الاعتمادات -

حالات استخدام قوية

استخدم OmniHuman عندما يكون الأصل التسويقي هو الشخص أو الشخصية، وليس مشهد الخلفية.

توضيحات المتحدث الرسمي

قم بإنشاء مقطع قصير للمؤسس أو الخبير أو مقدم العلامة التجارية من صورة واحدة والنص المنطوق الدقيق.

رسائل المنتج المترجمة

أعد استخدام الوجه نفسه عبر المسارات الصوتية المترجمة مع الحفاظ على تركيز المقطع على الكلام والتعبير.

التعليم الذي تقوده الشخصية

أنشئ دروسًا صغيرة متعددة بنفس صورة الشخصية ومسارات صوتية واضحة مختلفة.

حملات الصور الرمزية والمبدعين

أنشئ مقاطع متكررة بأسلوب منشئ المحتوى حيث توفر الهوية نفسها روابط أو عروض أو إعلانات جديدة.

طرق الاستوديو

Portrait Image to Talking Video

omnihuman_1_5

مقدر من الطول المحدد؛ يتحكم المسار الصوتي في السرعة

يتطلب عنوان URL واحدًا لصورة عمودية، وعنوان URL صوتيًا واحدًا للكلام، وسلوكًا قصيرًا prompt.

طريق مفتوح

كيف يختلف عن مزامنة الشفاه

يبدأ OmniHuman من صورة شخصية وصوت الكلام. تبدأ مزامنة الشفاه من مقطع فيديو موجود وتغير توقيت الفم ليتوافق مع الصوت الجديد.

سير عمل الإنتاج

  1. اختر صورة شخصية أو شخصية واضحة مع رؤية جيدة للوجه والحد الأدنى من الفوضى البصرية.
  2. إذا كانت الصورة تحتوي على عدة مواضيع، فقم بإجراء فحص للموضوع واستخدم قناعًا للشخص الذي يجب أن يتحدث.
  3. قم بإعداد صوت الكلام النظيف مع النص النهائي، ويفضل أن يكون 15 ثانية أو أقل للحصول على أفضل جودة.
  4. اكتب سلوكًا قصيرًا prompt مع النبرة والتعبير والوضعية والحركة الطبيعية.
  5. استخدم 1080 بكسل للمقاطع المصقولة، أو الوضع السريع عندما لا تزال تختبر البرامج النصية.
  6. أعد استخدام نفس الصورة الشخصية والأصلية ونمط prompt عندما تحتاج إلى سلسلة عروض تقديمية متسقة.

التعليمات

ماذا يحتاج OmniHuman؟

عنوان URL واحد للصورة الشخصية، وعنوان URL واحد للصوت الخاص بالكلام، وprompt للتعبير أو السلوك.

هل أدوات الكشف المساعدة هي نموذج فيديو؟

لا. مسار الاستوديو هو مسار إنشاء الفيديو؛ تعتبر مساعدات الكشف عبارة عن عمليات فحص منفصلة ولا يتم عرضها كنماذج فيديو.

كم من الوقت يمكن أن يكون الصوت؟

يجب أن يكون الصوت أقل من 60 ثانية. للحصول على جودة أقوى للوجه، احتفظ بالمقاطع لمدة 15 ثانية تقريبًا أو أقل.

ما هي تنسيقات الصور التي تعمل؟

استخدم عناوين URL لصور JPEG أو PNG أو WEBP بحجم يصل إلى 10 ميجابايت.

ماذا يفعل إدخال القناع؟

يساعد القناع في تحديد موضوع واحد عندما تحتوي الصورة على عدة أشخاص أو عندما لا تؤدي الخلفية إلى تشغيل الرسوم المتحركة.

ماذا يفعل الوضع السريع؟

يعمل الوضع السريع على تسريع عملية الإنشاء ولكنه قد يقلل من التفاصيل وجودة الحركة.

ما هي التكلفة؟

تكاليف المسار 27 اعتماد لكل إخراج الثانية.