🪄 Introducing daVinci-MagiHuman: The Performance-Level Audio-Video Generative Foundation Model Proudly open-sourced and jointly developed by SII GAIR Lab & Sand.ai, it sets a new standard for multimodal AI. ⏳ 1/6
مولّد فيديو daVinci MagiHuman من النص/الصورة مع مزامنة الصوت
أنشئ مقاطع فيديو باستخدام daVinci MagiHuman - نموذج أساسي مفتوح المصدر للصوت والفيديو بحجم 15 مليار معامل من Sand.ai وSII GAIR Lab. أنشئ فيديو وصوتاً متزامنين من نص أو صور بدقة مزامنة شفاه رائدة في الصناعة عبر 7 لغات. يدعم دقة تصل إلى 1080p بمدة 5-10 ثوانٍ. مدعوم بمعمارية Transformer أحادية التدفق بلا انتباه متقاطع، ينتج فيديو 256p لمدة 5 ثوانٍ في ثانيتين فقط على معالج H100 واحد.
/video/text-to-videoمعرض داVinci MagiHuman لتحويل النص إلى فيديو
استمتع بالقوة السينمائية لتوليد الفيديو من النص باستخدام daVinci MagiHuman. أنشئ مقاطع فيديو مذهلة بصوت متزامن من أوصاف نصية مفصّلة، مع مزامنة شفاه رائدة في الصناعة عبر 7 لغات.
ليلة ممطرة في طوكيو
امرأة ترتدي معطفاً أحمر تمشي في زقاق طوكيو المضاء بأضواء النيون في ليلة ممطرة مع انعكاسات متلألئة.
“Rainy night in a neon-lit Tokyo alley, a woman in a red coat walks slowly under an umbrella. Reflections shimmer on wet cobblestones. Handheld camera follows her from behind, bokeh street lights, cinematic color grade, moody atmosphere.”
معرض daVinci MagiHuman لتحويل الصور إلى فيديو
حوّل صورك الثابتة إلى مقاطع فيديو ديناميكية مع daVinci MagiHuman. استمتع بتحويل سلس من الصورة إلى الفيديو مع تعبيرات وجه واقعية، وحركة جسد طبيعية، وصوت متزامن مع حركة الشفاه.

مضيف بودكاست يتحدث
مقاطع فيديو daVinci MagiHuman على يوتيوب
شاهد عروضًا ومراجعات من المجتمع تستعرض قدرات daVinci MagiHuman في توليد الصوت والفيديو
- daVinci-MagiHuman: Fast Audio-Video Synthesis - AI Research Roundup
- 达芬奇最新开源模型,革命Seedance2.0 DaVinci-MagiHuman:开源音视频生成新标杆,5秒视频2秒出,还能说6种语言! - XIAOXIAO LI
- LTX 2.3, Veo и Sora больше не нужны? Тестируем daVinci-MagiHuman - ServerFlow AI Lab - R&D в области ИИ и LLM
- Ai动画224-化繁为简!daVinci-MagiHuman,快速音视频生成基础模型的单流架构,支持多国语言,音画同步,音色参考-T8 Comfyui教程 - T8star-Aix
مقاطع فيديو daVinci MagiHuman على يوتيوب
شاهد عروضًا ومراجعات من المجتمع تستعرض قدرات daVinci MagiHuman في توليد الصوت والفيديو
أبرز تقييمات daVinci MagiHuman على X
اطّلع على آراء الناس حول daVinci MagiHuman على X (تويتر)
daVinci-MagiHuman is a 15B single-stream Transformer, trained from scratch to generate synced video+audio with self-attention only—no cross-attention or multi-stream paths. It is open-source, supports 6 languages, beats Ovi/LTX, and runs on one H100.
I have been testing open source daVinci-MagiHuman, a single-stream 15B Transformer trained from scratch that jointly generates video + audio. 5s 1080p video in 38s on a single H100, about 1 minute on newer gaming Nvidia GPUs By @SII_GAIR + @SandAI_HQ
daVinci-MagiHumanという新しい動画生成モデルがオープンで出た。これがLTX-2.3よりもすごいとかいう話。特にオーディオ生成がいい感じらしい。さらに多言語対応してて日本語の音声も対応してると書かれてる。開発したGAIRってのは上海イノベーション研究所内の研究ラボらしい reddit.com/r/StableDiffus…
映像と音声を同時生成のオープンソースモデル「daVinci-MagiHuman」が登場 ・OSS界隈ではトップクラスの性能 ・日中英韓独仏の6言語対応 ・音声認識誤り率14.6% クローズドのSeedance 2.0に対抗。デモの感じは精度が高そう H100で5秒間の1080p動画を38秒で生成したらしい
動画生成AIはオープンソースでも戦えるか? daVinci-MagiHuman は、動画と音声をシングルストリームの15B Transformerで同時生成する完全オープンソースモデル。 Ovi 1.1に80.0%、LTX 2.3に60.9%勝率。 H100で1080pの5秒の動画を38.4秒で生成。日本語にも対応! 詳細は🧵
DaVinci-MagiHuman for ComfyUI. - 15B-param single-stream model runs in ~6GB VRAM via block-level swapping; - 8-step distillation; github.com/mjansrud/Comfy…
daVinci-MagiHuman. We have another fast single-stream audio-video 15B foundation model by @SandAI_HQ > no separate pathways or cross-attention modules. > just raw self-attention doing all the heavy lifting. > wins 80% vs Ovi 1.1, 60% vs LTX 2.3; > native multilingual realistic
ما هو daVinci MagiHuman
نموذج تأسيسي مفتوح المصدر للصوت والفيديو من Sand.ai بحجم 15 مليار معامل مع أفضل مزامنة للشفاه في فئته
- · 0115Bالمعاملات
- · 021080pأقصى دقة
- · 037اللغات المدعومة
- · 042sسرعة إنشاء 256p
daVinci MagiHuman هو محول (Transformer) أحادي التدفق بـ 15 مليار معامل ينشئ فيديو وصوتًا متزامنين معًا من النص أو الصور، محققًا دقة رائدة في الصناعة لمزامنة الشفاه بمعدل خطأ كلمات 14.6% عبر 7 لغات.
ميزات daVinci MagiHuman القوية
اكتشف القدرات المتقدمة التي تجعل daVinci MagiHuman استثنائيًا في توليد الصوت والفيديو
- Feature 01 / 08
توليد مشترك للصوت والفيديو
أنتج فيديو وصوتًا متزامنين في مرور واحد باستخدام بنية محول أحادية التدفق موحدة تعتمد فقط على الانتباه الذاتي، مما يلغي الحاجة إلى خطوط معالجة صوتية منفصلة.
- Feature 02 / 08
مزامنة شفاه رائدة في المجال
حقق معدل خطأ في الكلمات يبلغ 14.6% في مزامنة الشفاه، متفوقًا بشكل كبير على منافسين مثل Ovi 1.1 (40.45%) وLTX 2.3 (19.23%) في معايير دقة الكلام.
- Feature 03 / 08
دعم الكلام بـ 7 لغات
أنتج فيديوهات متزامنة مع الكلام باللغات الإنجليزية والصينية (الماندرين والكانتونية) واليابانية والكورية والألمانية والفرنسية بنطق طبيعي وحركات شفاه واقعية.
- Feature 04 / 08
توليد فائق السرعة
أنتج فيديو مدته 5 ثوانٍ بدقة 256p في ثانيتين فقط على معالج رسومات H100 واحد. يلغي التقطير DMD-2 المكوّن من 8 خطوات الحاجة إلى التوجيه الخالي من المصنف دون فقدان الجودة.
- Feature 05 / 08
وضعا إدخال مزدوجان
أنشئ فيديوهات من طلبات نصية أو حرّك صورًا ثابتة. يدعم كلا وضعي النص إلى فيديو والصورة إلى فيديو نسب عرض إلى ارتفاع ودرجات دقة ومددًا زمنية قابلة للتخصيص من 5 إلى 10 ثوانٍ.
- Feature 06 / 08
دقة فائقة تصل إلى 1080p
أنتج فيديوهات بدقة 256p أو 540p أو 720p أو 1080p عبر خط معالجة دقة فائقة في الفضاء الكامن يرفع الدقة دون عبء إضافي لفك وترميز VAE، لإنتاج مخرجات عالية الدقة بكفاءة.
- Feature 07 / 08
مفتوح المصدر بترخيص Apache 2.0
مفتوح المصدر بالكامل بموجب ترخيص Apache 2.0 مع مجموعة كاملة تشمل الأوزان الأساسية والنموذج المقطّر ونموذج الدقة الفائقة وكود الاستدلال، للاستخدام التجاري دون قيود.
- Feature 08 / 08
تميّز محوره الإنسان
متخصص في توليد البشر الرقميين بأداء وجهي معبّر وحركة جسدية واقعية والحفاظ على اتساق الشخصية عبر الإطارات، لمحتوى احترافي لشخصيات متحدثة.
الأسئلة الشائعة
أسئلة شائعة حول توليد الصوت والفيديو في daVinci MagiHuman
هل لا تزال لديك أسئلة؟
كيفية استخدام daVinci MagiHuman لتحويل النص إلى فيديو
أنشئ مقاطع فيديو بصوت متزامن من أوصاف نصية
اكتب وصفك
أدخل وصفًا تفصيليًا للفيديو الذي تريد إنشاءه. أضف الموضوع والحركة ومحتوى الكلام واللغة المطلوبة للحصول على أفضل نتائج مزامنة الشفاه.
كيفية استخدام daVinci MagiHuman لتحويل الصورة إلى فيديو
حرّك الصور الثابتة إلى مقاطع فيديو بصوت متزامن
ارفع صورتك
ارفع صورة مرجعية للشخص أو المشهد الذي تريد تحريكه. يتفوق daVinci MagiHuman في المحتوى المرتكز على الأشخاص بتعابير وجه وحركات جسد واقعية.
أسعار مرنة للذكاء الاصطناعي
رصيد بنظام الدفع حسب الاستخدام أو خطط اشتراك. بدون رسوم خفية، يمكنك الإلغاء في أي وقت.
مرة واحدة يدعم الدفع بالعملات الرقمية (BTC, USDT, ETH, 350+)
Monthly billing