MiniMax H3 开源了,能生成带声音的视频,我帮你看懂它强在哪
技术笔记 1 次阅读

MiniMax H3 开源了,能生成带声音的视频,我帮你看懂它强在哪

MiniMax H3 开源

昨天晚上刷到 MiniMax 开源新一代视频模型 H3 的消息,说实话我第一反应是:终于等到开源了。之前看它家放的演示视频,能生成带原生声音的画面,效果确实唬人,但一直不开放,只能干瞪眼。这次 H3 直接放出来了,我连夜把技术文档啃了一遍,挑重点跟你们聊聊。

这个模型到底是干嘛的

简单说,H3 是一个全模态生成系统。它不是那种只能"文字变视频"的模型,而是能同时理解文本、图像、视频、音频四种输入,再统一生成带声音的视频。比如你给它一张首帧图,它能顺着画面往下演;给它一段视频加一段音频,它能理解上下文继续生成,最长能出 15 秒。

几个关键参数给你们列一下:输出时长 4 到 15 秒,帧率 24 FPS,音频是 32kHz 立体声,分辨率默认短边 768,想要更高清的可以走 H3-Regenerate-2K 通道,直接干到 2K。宽高比支持得挺全,21:9、16:9、4:3、1:1、3:4、9:16 都有。语言方面稳定支持 11 种,中英日韩法德意葡俄西阿,基本覆盖主流市场。

三个模块,各干各的活

H3 的架构挺有意思,拆成了三块。第一块叫 H3-Context-IR,专门负责"理解需求"——把复杂的多模态指令提炼成模型更容易消化的中间表示,官方建议接入生成流程时一定要带上它,对最终质量影响很大。第二块是 H3-Base,负责真正干活,输出 768p 的音视频。第三块是 H3-Regenerate-2K,把 Base 的结果连同原始上下文一起送回模型,以 2K 分辨率重新生成一遍,细节和保真度会好很多。

这个设计思路其实挺聪明:先生成个快的,再针对性精修,比直接硬怼 2K 省算力,效果还更稳。

对开发者来说意味着什么

最直观的变化是,做视频类应用的门槛又降了一截。以前想给产品加个"文生视频"功能,要么用闭源 API 按量付费,要么自己训模型——后者基本劝退个人开发者。现在 H3 开源了,走的是社区 License,模型权重在 HuggingFace 上直接能下,自己部署或者接 API 都行(商用条款记得自己确认一遍)。

另外我注意到一个细节:H3 支持最多 9 张图、3 段视频、3 段音频的混合参考输入,合计最多 12 个文件。这意味着你可以给它"一堆素材"让它自由发挥,而不是只能给一段 prompt。做短视频工具、游戏 CG 预演、电商商品视频的团队,这个玩法空间很大。

当然,15 秒的上限摆在那,距离"生成一部完整短片"还有距离。但说真的,从去年视频模型还在"能动就行",到现在开源模型能带立体声、能多模态理解,这进步速度已经够吓人了。下一步就看社区能拿它玩出什么花了。

分享

评论 (0)

评论通过后显示

暂无评论,来写第一条吧 ✍️