Logo
نماذج الفيديو

مولّد فيديو daVinci MagiHuman من النص/الصورة مع مزامنة الصوت

أنشئ مقاطع فيديو باستخدام daVinci MagiHuman - نموذج أساسي مفتوح المصدر للصوت والفيديو بحجم 15 مليار معامل من Sand.ai وSII GAIR Lab. أنشئ فيديو وصوتاً متزامنين من نص أو صور بدقة مزامنة شفاه رائدة في الصناعة عبر 7 لغات. يدعم دقة تصل إلى 1080p بمدة 5-10 ثوانٍ. مدعوم بمعمارية Transformer أحادية التدفق بلا انتباه متقاطع، ينتج فيديو 256p لمدة 5 ثوانٍ في ثانيتين فقط على معالج H100 واحد.

/video/text-to-video
عامة
*

معرض داVinci MagiHuman لتحويل النص إلى فيديو

استمتع بالقوة السينمائية لتوليد الفيديو من النص باستخدام daVinci MagiHuman. أنشئ مقاطع فيديو مذهلة بصوت متزامن من أوصاف نصية مفصّلة، مع مزامنة شفاه رائدة في الصناعة عبر 7 لغات.

أنشئ باستخدام daVinci MagiHuman
AI Video

ليلة ممطرة في طوكيو

امرأة ترتدي معطفاً أحمر تمشي في زقاق طوكيو المضاء بأضواء النيون في ليلة ممطرة مع انعكاسات متلألئة.

Prompt

Rainy night in a neon-lit Tokyo alley, a woman in a red coat walks slowly under an umbrella. Reflections shimmer on wet cobblestones. Handheld camera follows her from behind, bokeh street lights, cinematic color grade, moody atmosphere.

Live PipelineTake 01 / 01

معرض daVinci MagiHuman لتحويل الصور إلى فيديو

حوّل صورك الثابتة إلى مقاطع فيديو ديناميكية مع daVinci MagiHuman. استمتع بتحويل سلس من الصورة إلى الفيديو مع تعبيرات وجه واقعية، وحركة جسد طبيعية، وصوت متزامن مع حركة الشفاه.

Source Feeds01 Inputs
مضيف بودكاست يتحدث - Input 1
Program · On AirAI · Generated
Output
Transcript · 01

مضيف بودكاست يتحدث

مقاطع فيديو daVinci MagiHuman على يوتيوب

شاهد عروضًا ومراجعات من المجتمع تستعرض قدرات daVinci MagiHuman في توليد الصوت والفيديو

  • daVinci-MagiHuman: Fast Audio-Video Synthesis - AI Research Roundup
  • 达芬奇最新开源模型,革命Seedance2.0 DaVinci-MagiHuman:开源音视频生成新标杆,5秒视频2秒出,还能说6种语言! - XIAOXIAO LI
  • LTX 2.3, Veo и Sora больше не нужны? Тестируем daVinci-MagiHuman - ServerFlow AI Lab - R&D в области ИИ и LLM
  • Ai动画224-化繁为简!daVinci-MagiHuman,快速音视频生成基础模型的单流架构,支持多国语言,音画同步,音色参考-T8 Comfyui教程 - T8star-Aix

مقاطع فيديو daVinci MagiHuman على يوتيوب

شاهد عروضًا ومراجعات من المجتمع تستعرض قدرات daVinci MagiHuman في توليد الصوت والفيديو

أبرز تقييمات daVinci MagiHuman على X

اطّلع على آراء الناس حول daVinci MagiHuman على X (تويتر)

映像と音声を同時生成のオープンソースモデル「daVinci-MagiHuman」が登場 ・OSS界隈ではトップクラスの性能 ・日中英韓独仏の6言語対応 ・音声認識誤り率14.6% クローズドのSeedance 2.0に対抗。デモの感じは精度が高そう H100で5秒間の1080p動画を38秒で生成したらしい

Reply

DaVinci-MagiHuman for ComfyUI. - 15B-param single-stream model runs in ~6GB VRAM via block-level swapping; - 8-step distillation; github.com/mjansrud/Comfy…

Wildminder
Wildminder
@wildmindai

daVinci-MagiHuman. We have another fast single-stream audio-video 15B foundation model by @SandAI_HQ > no separate pathways or cross-attention modules. > just raw self-attention doing all the heavy lifting. > wins 80% vs Ovi 1.1, 60% vs LTX 2.3; > native multilingual realistic

Reply
Reel · Specifications

ما هو daVinci MagiHuman

نموذج تأسيسي مفتوح المصدر للصوت والفيديو من Sand.ai بحجم 15 مليار معامل مع أفضل مزامنة للشفاه في فئته

  1. · 0115Bالمعاملات
  2. · 021080pأقصى دقة
  3. · 037اللغات المدعومة
  4. · 042sسرعة إنشاء 256p

daVinci MagiHuman هو محول (Transformer) أحادي التدفق بـ 15 مليار معامل ينشئ فيديو وصوتًا متزامنين معًا من النص أو الصور، محققًا دقة رائدة في الصناعة لمزامنة الشفاه بمعدل خطأ كلمات 14.6% عبر 7 لغات.

Reel · Capabilities

ميزات daVinci MagiHuman القوية

اكتشف القدرات المتقدمة التي تجعل daVinci MagiHuman استثنائيًا في توليد الصوت والفيديو

  1. Feature 01 / 08

    توليد مشترك للصوت والفيديو

    أنتج فيديو وصوتًا متزامنين في مرور واحد باستخدام بنية محول أحادية التدفق موحدة تعتمد فقط على الانتباه الذاتي، مما يلغي الحاجة إلى خطوط معالجة صوتية منفصلة.

  2. Feature 02 / 08

    مزامنة شفاه رائدة في المجال

    حقق معدل خطأ في الكلمات يبلغ 14.6% في مزامنة الشفاه، متفوقًا بشكل كبير على منافسين مثل Ovi 1.1 (40.45%) وLTX 2.3 (19.23%) في معايير دقة الكلام.

  3. Feature 03 / 08

    دعم الكلام بـ 7 لغات

    أنتج فيديوهات متزامنة مع الكلام باللغات الإنجليزية والصينية (الماندرين والكانتونية) واليابانية والكورية والألمانية والفرنسية بنطق طبيعي وحركات شفاه واقعية.

  4. Feature 04 / 08

    توليد فائق السرعة

    أنتج فيديو مدته 5 ثوانٍ بدقة 256p في ثانيتين فقط على معالج رسومات H100 واحد. يلغي التقطير DMD-2 المكوّن من 8 خطوات الحاجة إلى التوجيه الخالي من المصنف دون فقدان الجودة.

  5. Feature 05 / 08

    وضعا إدخال مزدوجان

    أنشئ فيديوهات من طلبات نصية أو حرّك صورًا ثابتة. يدعم كلا وضعي النص إلى فيديو والصورة إلى فيديو نسب عرض إلى ارتفاع ودرجات دقة ومددًا زمنية قابلة للتخصيص من 5 إلى 10 ثوانٍ.

  6. Feature 06 / 08

    دقة فائقة تصل إلى 1080p

    أنتج فيديوهات بدقة 256p أو 540p أو 720p أو 1080p عبر خط معالجة دقة فائقة في الفضاء الكامن يرفع الدقة دون عبء إضافي لفك وترميز VAE، لإنتاج مخرجات عالية الدقة بكفاءة.

  7. Feature 07 / 08

    مفتوح المصدر بترخيص Apache 2.0

    مفتوح المصدر بالكامل بموجب ترخيص Apache 2.0 مع مجموعة كاملة تشمل الأوزان الأساسية والنموذج المقطّر ونموذج الدقة الفائقة وكود الاستدلال، للاستخدام التجاري دون قيود.

  8. Feature 08 / 08

    تميّز محوره الإنسان

    متخصص في توليد البشر الرقميين بأداء وجهي معبّر وحركة جسدية واقعية والحفاظ على اتساق الشخصية عبر الإطارات، لمحتوى احترافي لشخصيات متحدثة.

FAQ

الأسئلة الشائعة

أسئلة شائعة حول توليد الصوت والفيديو في daVinci MagiHuman

يدعم daVinci MagiHuman وضعين أساسيين للإدخال: النص إلى فيديو (توليد فيديوهات بصوت متزامن من موجّهات نصية) والصورة إلى فيديو (تحريك صور ثابتة إلى فيديوهات متحركة مع صوت اختياري). يدعم كلا الوضعين نسب عرض إلى ارتفاع قابلة للتخصيص (16:9 أفقي، 9:16 عمودي)، ودقة تصل إلى 1080p، ومدة من 5 إلى 10 ثوانٍ.
يدعم daVinci MagiHuman توليد كلام متزامن بـ7 لغات: الإنجليزية، الصينية (الماندرين)، الكانتونية، اليابانية، الكورية، الألمانية، والفرنسية. يحقق النموذج معدل خطأ في الكلمات (WER) بنسبة 14.6% لمزامنة الشفاه، متفوقاً بشكل ملحوظ على منافسين مثل Ovi 1.1 (بنسبة 40.45%) وLTX 2.3 (بنسبة 19.23%).
يدعم daVinci MagiHuman عدة دقّات: 256p (الأسرع)، 540p (فائقة الدقة)، 720p، و1080p (فائقة الدقة). يمكن تخصيص مدة الفيديو من 5 إلى 10 ثوانٍ بدقة ثانية واحدة. كما يُدعم كل من الوضع الأفقي (16:9) والعمودي (9:16).
على معالج رسومي واحد من طراز NVIDIA H100، يُنشئ daVinci MagiHuman فيديو بدقة 256p ومدة 5 ثوانٍ في نحو ثانيتين. أما بالنسبة للدقّات الأعلى، فتزداد أوقات التوليد: يستغرق 540p نحو 8 ثوانٍ، ويستغرق 1080p نحو 38.4 ثانية لفيديو مدته 5 ثوانٍ. تتحقق هذه السرعة بفضل تقنية التقطير 8-step DMD-2 التي تُلغي الحاجة إلى classifier-free guidance.
نعم، daVinci MagiHuman مفتوح المصدر بالكامل بموجب ترخيص Apache 2.0 من قِبل Sand.ai وSII GAIR Lab. تتوفر المجموعة الكاملة من الأدوات، بما في ذلك أوزان النموذج الأساسي، والنموذج المُقطَّر، ونموذج فائق الدقة، وكود الاستدلال، مما يسمح بالاستخدام التجاري والتعديل والتوزيع دون قيود.
يتميّز daVinci MagiHuman بمعماريته الفريدة أحادية التدفق القائمة على المحوّلات (Transformer) والتي تستخدم الانتباه الذاتي (self-attention) فقط دون الانتباه المتقاطع (cross-attention) أو المسارات متعددة التدفقات، مما يتيح التوليد المشترك للصوت والفيديو في نموذج واحد. يحقق أفضل دقة في مزامنة الشفاه في فئته (14.6% WER)، ويدعم 7 لغات للكلام، ويسجّل نسبة فوز 80% مقابل Ovi 1.1 في تقييم بشري لجودة الصورة.

كيفية استخدام daVinci MagiHuman لتحويل النص إلى فيديو

أنشئ مقاطع فيديو بصوت متزامن من أوصاف نصية

اكتب وصفك

أدخل وصفًا تفصيليًا للفيديو الذي تريد إنشاءه. أضف الموضوع والحركة ومحتوى الكلام واللغة المطلوبة للحصول على أفضل نتائج مزامنة الشفاه.

كيفية استخدام daVinci MagiHuman لتحويل الصورة إلى فيديو

حرّك الصور الثابتة إلى مقاطع فيديو بصوت متزامن

ارفع صورتك

ارفع صورة مرجعية للشخص أو المشهد الذي تريد تحريكه. يتفوق daVinci MagiHuman في المحتوى المرتكز على الأشخاص بتعابير وجه وحركات جسد واقعية.

Pricing · Choose Yours

أسعار مرنة للذكاء الاصطناعي

رصيد بنظام الدفع حسب الاستخدام أو خطط اشتراك. بدون رسوم خفية، يمكنك الإلغاء في أي وقت.

مرة واحدة يدعم الدفع بالعملات الرقمية (BTC, USDT, ETH, 350+)

Monthly billing

مجاني

جرّب قبل الشراء

0
مرة واحدة
USD
مجاني
32رصيد
3 فيديو
32 صور
دعم نماذج متعددة
نص إلى فيديو
صورة إلى فيديو
فيديو إلى فيديو
شخصية متسقة
مولّد الرسوم المتحركة
قوالب وتأثيرات
تحسين الفيديو بالذكاء الاصطناعي
مجتمع تفاعلي
سرعة توليد أعلى
بدون علامة مائية
حركة كاميرا أكثر
خصوصية الفيديو
حماية النسخ
دعم ذو أولوية
الأكثر شيوعاً

Pro

ارتقِ بتجربتك مع الذكاء الاصطناعي

29.99
1 شهر
USD
800
800رصيد1 شهر
80 فيديو1 شهر
800 صور1 شهر
3 مهام(مهام متوازية)
دعم نماذج متعددة
نص إلى فيديو
صورة إلى فيديو
فيديو إلى فيديو
شخصية متسقة
مولّد الرسوم المتحركة
قوالب وتأثيرات
تحسين الفيديو بالذكاء الاصطناعي
مجتمع تفاعلي
سرعة توليد أعلى
بدون علامة مائية
حركة كاميرا أكثر
خصوصية الفيديو
حماية النسخ
دعم ذو أولوية

Lite

ابدأ رحلتك مع الذكاء الاصطناعي

19.99
1 شهر
USD
300رصيد1 شهر
30 فيديو1 شهر
300 صور1 شهر
3 مهام(مهام متوازية)
دعم نماذج متعددة
نص إلى فيديو
صورة إلى فيديو
فيديو إلى فيديو
شخصية متسقة
مولّد الرسوم المتحركة
قوالب وتأثيرات
تحسين الفيديو بالذكاء الاصطناعي
مجتمع تفاعلي
سرعة توليد أعلى
بدون علامة مائية
حركة كاميرا أكثر
خصوصية الفيديو
حماية النسخ
دعم ذو أولوية