Logo
Mô hình video

Trình tạo video từ văn bản / ảnh daVinci MagiHuman có đồng bộ âm thanh

Tạo video với daVinci MagiHuman - mô hình nền tảng âm thanh - video mã nguồn mở 15 tỷ tham số của Sand.ai và SII GAIR Lab. Tạo video và âm thanh đồng bộ từ văn bản hoặc hình ảnh với độ chính xác khớp khẩu hình dẫn đầu ngành trên 7 ngôn ngữ. Hỗ trợ độ phân giải tới 1080p với thời lượng 5-10 giây. Chạy trên kiến trúc Transformer luồng đơn không dùng cross-attention, cho ra video 256p dài 5 giây chỉ trong 2 giây trên một GPU H100.

/video/text-to-video

Thư viện văn bản thành video của daVinci MagiHuman

Trải nghiệm sức mạnh điện ảnh của khả năng tạo văn bản thành video từ daVinci MagiHuman. Hãy tạo những video ấn tượng kèm âm thanh đồng bộ chỉ từ mô tả văn bản chi tiết, với khả năng khớp khẩu hình dẫn đầu ngành trên 7 ngôn ngữ.

Sáng tạo với daVinci MagiHuman
AI Video

Đêm mưa ở Tokyo

Một người phụ nữ khoác áo đỏ đi qua con hẻm Tokyo rực ánh đèn neon trong đêm mưa với những mặt phản chiếu lấp lánh.

Prompt

Rainy night in a neon-lit Tokyo alley, a woman in a red coat walks slowly under an umbrella. Reflections shimmer on wet cobblestones. Handheld camera follows her from behind, bokeh street lights, cinematic color grade, moody atmosphere.

Live PipelineTake 01 / 01

Thư viện ảnh thành video của daVinci MagiHuman

Biến ảnh tĩnh của bạn thành video sống động với daVinci MagiHuman. Trải nghiệm quá trình chuyển ảnh thành video mượt mà với biểu cảm gương mặt chân thực, chuyển động cơ thể tự nhiên và âm thanh khớp khẩu hình đồng bộ.

Source Feeds01 Inputs
Người dẫn podcast đang nói - Input 1
Program · On AirAI · Generated
Output
Transcript · 01

Người dẫn podcast đang nói

Video YouTube về daVinci MagiHuman

Xem các video minh họa và đánh giá từ cộng đồng giới thiệu khả năng tạo âm thanh - hình ảnh của daVinci MagiHuman

  • daVinci-MagiHuman: Fast Audio-Video Synthesis - AI Research Roundup
  • 达芬奇最新开源模型,革命Seedance2.0 DaVinci-MagiHuman:开源音视频生成新标杆,5秒视频2秒出,还能说6种语言! - XIAOXIAO LI
  • LTX 2.3, Veo и Sora больше не нужны? Тестируем daVinci-MagiHuman - ServerFlow AI Lab - R&D в области ИИ и LLM
  • Ai动画224-化繁为简!daVinci-MagiHuman,快速音视频生成基础模型的单流架构,支持多国语言,音画同步,音色参考-T8 Comfyui教程 - T8star-Aix

Video YouTube về daVinci MagiHuman

Xem các video minh họa và đánh giá từ cộng đồng giới thiệu khả năng tạo âm thanh - hình ảnh của daVinci MagiHuman

Đánh giá nổi bật về daVinci MagiHuman trên X

Xem mọi người nói gì về daVinci MagiHuman trên X (Twitter)

Reel · Specifications

daVinci MagiHuman là gì

Mô hình nền tảng âm thanh - video mã nguồn mở 15B của Sand.ai với khả năng khớp khẩu hình hàng đầu

  1. · 0115BTham số
  2. · 021080pĐộ phân giải tối đa
  3. · 037Ngôn ngữ được hỗ trợ
  4. · 042sTốc độ tạo ở 256p

daVinci MagiHuman là một Transformer luồng đơn 15 tỷ tham số, tạo đồng thời video và âm thanh khớp nhau từ văn bản hoặc ảnh, đạt độ chính xác khớp khẩu hình dẫn đầu ngành với tỷ lệ lỗi từ 14,6% trên 7 ngôn ngữ.

Reel · Capabilities

Những tính năng mạnh mẽ của daVinci MagiHuman

Khám phá những khả năng tiên tiến khiến daVinci MagiHuman trở nên đặc biệt trong việc tạo video kèm âm thanh

  1. Feature 01 / 08

    Tạo đồng thời video và âm thanh

    Tạo video và âm thanh đồng bộ chỉ trong một lượt nhờ kiến trúc Transformer dòng đơn thống nhất chỉ dùng self-attention, loại bỏ nhu cầu về các quy trình xử lý âm thanh riêng.

  2. Feature 02 / 08

    Khớp khẩu hình dẫn đầu ngành

    Đạt tỷ lệ lỗi từ 14.6% khi khớp khẩu hình, vượt xa các đối thủ như Ovi 1.1 (40.45%) và LTX 2.3 (19.23%) trong các bài đo độ chính xác giọng nói.

  3. Feature 03 / 08

    Hỗ trợ giọng nói 7 ngôn ngữ

    Tạo video đồng bộ giọng nói bằng tiếng Anh, tiếng Trung (Quan Thoại và Quảng Đông), tiếng Nhật, tiếng Hàn, tiếng Đức và tiếng Pháp với phát âm và khẩu hình tự nhiên.

  4. Feature 04 / 08

    Tạo video siêu nhanh

    Tạo video 256p dài 5 giây chỉ trong 2 giây trên một GPU H100 duy nhất. Kỹ thuật chưng cất DMD-2 8 bước loại bỏ nhu cầu classifier-free guidance mà không giảm chất lượng.

  5. Feature 05 / 08

    Hai chế độ đầu vào

    Tạo video từ prompt văn bản hoặc làm chuyển động cho ảnh tĩnh. Cả chế độ văn bản thành video và ảnh thành video đều hỗ trợ tỷ lệ khung hình, độ phân giải và thời lượng tùy chỉnh từ 5 đến 10 giây.

  6. Feature 06 / 08

    Siêu phân giải lên tới 1080p

    Tạo video ở 256p, 540p, 720p hoặc 1080p thông qua quy trình siêu phân giải trong không gian tiềm ẩn, nâng độ phân giải mà không tốn thêm chi phí giải mã - mã hóa VAE, cho đầu ra độ phân giải cao hiệu quả.

  7. Feature 07 / 08

    Mã nguồn mở Apache 2.0

    Hoàn toàn mã nguồn mở theo giấy phép Apache 2.0 với đầy đủ bộ công cụ gồm trọng số gốc, mô hình chưng cất, mô hình siêu phân giải và mã suy luận để sử dụng thương mại không giới hạn.

  8. Feature 08 / 08

    Vượt trội với nội dung lấy con người làm trung tâm

    Chuyên tạo người kỹ thuật số với biểu cảm khuôn mặt sống động, chuyển động cơ thể chân thực và nhân vật đồng nhất qua từng khung hình cho nội dung người dẫn chuyên nghiệp.

FAQ

Câu hỏi thường gặp

Các câu hỏi thường gặp về khả năng tạo âm thanh - video của daVinci MagiHuman

daVinci MagiHuman hỗ trợ hai chế độ đầu vào chính: Văn bản thành video (tạo video kèm âm thanh đồng bộ từ prompt văn bản) và Ảnh thành video (làm ảnh tĩnh chuyển động thành video, có thể kèm âm thanh). Cả hai chế độ đều hỗ trợ tỷ lệ khung hình tùy chỉnh (16:9 ngang, 9:16 dọc), độ phân giải tới 1080p và thời lượng từ 5 đến 10 giây.
daVinci MagiHuman hỗ trợ tạo giọng nói đồng bộ ở 7 ngôn ngữ: tiếng Anh, tiếng Trung (Quan Thoại), tiếng Quảng Đông, tiếng Nhật, tiếng Hàn, tiếng Đức và tiếng Pháp. Mô hình đạt tỷ lệ lỗi từ 14.6% khi khớp khẩu hình, vượt trội đáng kể so với các đối thủ như Ovi 1.1 (40.45% WER) và LTX 2.3 (19.23% WER).
daVinci MagiHuman hỗ trợ nhiều độ phân giải: 256p (nhanh nhất), 540p (siêu phân giải), 720p và 1080p (siêu phân giải). Thời lượng video có thể đặt từ 5 đến 10 giây với bước nhảy 1 giây. Cả tỷ lệ ngang (16:9) lẫn dọc (9:16) đều được hỗ trợ.
Trên một GPU NVIDIA H100 đơn lẻ, daVinci MagiHuman tạo một video 256p dài 5 giây trong khoảng 2 giây. Với độ phân giải cao hơn, thời gian tạo tăng lên: 540p mất khoảng 8 giây và 1080p mất khoảng 38.4 giây cho một video 5 giây. Tốc độ này có được nhờ kỹ thuật chưng cất DMD-2 8 bước, loại bỏ classifier-free guidance.
Có, daVinci MagiHuman được Sand.ai và SII GAIR Lab mở mã nguồn hoàn toàn theo giấy phép Apache 2.0. Toàn bộ hệ thống đều sẵn có, gồm trọng số mô hình gốc, mô hình đã chưng cất, mô hình siêu phân giải và mã suy luận, cho phép sử dụng thương mại, chỉnh sửa và phân phối không hạn chế.
daVinci MagiHuman nổi bật với kiến trúc Transformer luồng đơn độc đáo chỉ dùng self-attention (không có cross-attention hay các luồng song song), cho phép tạo đồng thời âm thanh và video trong cùng một mô hình. Nó đạt độ chính xác khớp khẩu hình hàng đầu (14.6% WER), hỗ trợ 7 ngôn ngữ cho giọng nói và có tỷ lệ thắng 80% trước Ovi 1.1 trong đánh giá chất lượng hình ảnh bởi con người.

Cách dùng daVinci MagiHuman Văn bản thành video

Tạo video kèm âm thanh đồng bộ từ mô tả văn bản

Viết prompt của bạn

Hãy nhập mô tả chi tiết về video bạn muốn tạo. Nêu rõ chủ thể, hành động, nội dung lời thoại và ngôn ngữ mong muốn để có kết quả khớp khẩu hình tốt nhất.

Cách dùng daVinci MagiHuman Ảnh thành video

Biến ảnh tĩnh thành video kèm âm thanh đồng bộ

Tải ảnh của bạn lên

Tải lên ảnh tham chiếu của người hoặc khung cảnh bạn muốn làm chuyển động. daVinci MagiHuman đặc biệt mạnh với nội dung xoay quanh con người, cho biểu cảm khuôn mặt và cử động cơ thể chân thực.

Pricing · Choose Yours

Bảng giá AI linh hoạt

Mua tín dụng theo nhu cầu hoặc đăng ký gói. Không phí ẩn, hủy bất cứ lúc nào.

Một lần hỗ trợ thanh toán bằng tiền mã hóa (BTC, USDT, ETH, 350+)

Monthly billing

Free

Try before you buy

0
Một lần
USD
Free
32points
Up to 3 videos
Up to 32 images
Multi-Model Support
Text to Video
Image to Video
Video to Video
Consistent Character
AI Animation Generator
Templates & Effects
AI Video Enhancers
Interactive Community
Faster Generation Speed
No-watermark Outputs
More Camera Movement
Private Video Visibility
Copy Protection
Priority Support
Phổ biến

Pro

Elevate your AI experience

29.99
1 tháng
USD
800
800points1 tháng
Up to 80 videos1 tháng
Up to 800 images1 tháng
3 tasks(Parallel Tasks)
Multi-Model Support
Text to Video
Image to Video
Video to Video
Consistent Character
AI Animation Generator
Templates & Effects
AI Video Enhancers
Interactive Community
Faster Generation Speed
No-watermark Outputs
More Camera Movement
Private Video Visibility
Copy Protection
Priority Support

Lite

Start your AI journey

19.99
1 tháng
USD
300points1 tháng
Up to 30 videos1 tháng
Up to 300 images1 tháng
3 tasks(Parallel Tasks)
Multi-Model Support
Text to Video
Image to Video
Video to Video
Consistent Character
AI Animation Generator
Templates & Effects
AI Video Enhancers
Interactive Community
Faster Generation Speed
No-watermark Outputs
More Camera Movement
Private Video Visibility
Copy Protection
Priority Support