查看: 79|回复: 1

视觉大模型迎来开源重磅消息!多模态生成再升级,2K高清音画如何颠覆行业?

62

主题

0

回帖

186

积分

注册会员

积分
186
发表于 2026-8-3 14:55:30 | 显示全部楼层 |阅读模式
AI总结
AI总结中
8 月 3 日,人工智能企业 MiniMax 正式宣布开源其新一代通用视频模型MiniMax H3。作为一款全模态生成系统,该模型打破了传统单任务的界限,能够深度融合并理解由文本、图像、视频以及音频交织而成的多模态上下文,展现出极强的任务泛化能力。

在生成规格上,H3 支持 4 到 15 秒的时长输出,并提供 24 FPS 帧率以及 32 kHz 立体声。用户不仅可以根据需求选择 21:9、16:9、4:3、1:1 等多种常见宽高比,还能通过默认将较短边设为 768 像素的常规模式进行基础创作。而借助专用的 H3-Regenerate-2K 方案,模型更能输出高达 2K 分辨率的惊艳画面。在多语言交互方面,它能够稳定支持阿拉伯语、中文、英语、法德意、日韩及西葡俄等 11 种主流语言。

为了适应多样化的创作场景,H3 推出了灵活的模型版本与丰富的输入规格。其中,H3-Base-FL2VA 首尾帧模式支持输入 0 到 2 张图像,能够自由灵活地应对文生视频、首帧生视频、尾帧生视频以及首尾帧协同生成的不同任务。而 H3-Base-Ref2VA 全模态参考模式则支持最多 9 张图像、3 段视频(总时长不超过 15 秒)以及 3 段音频的混合输入,文件总数最高可达 12 个,为专业创作者提供了前所未有的精细控制手段。

在系统架构的底层设计上,完整的 MiniMax H3 包含三个核心模块。首先是 H3-Context-IR(上下文中间表示),它能够将复杂的多元指令深度剖析并转化为模型易于理解的结构,是保障高品质输出的关键环节;其次是负责生成 768p 基础音视频的 H3-Base 模块;最后则是通过将初始结果与原始上下文回传实现 2K 超分重构的 H3-Regenerate-2K 模块。这一组合既保留了生动的细节,又极大提升了视觉的保真度。

目前,该模型已基于 MiniMax H3 Community License 正式发布,相关开发者与技术爱好者可以通过Hugging Face获取完整的开源代码与资源。业内普遍认为,此次开源将进一步降低多模态视频生成的应用门槛,推动影视创作、视觉设计及 AI 交互迈向全新的高度。

Source URL: https://news.aibase.com/zh/news/30069

0

主题

0

回帖

4

积分

新手上路

积分
4
发表于 2026-8-4 02:21:28 来自手机 | 显示全部楼层

戏精本人 发表于 2026-8-3 14:55
视觉大模型迎来开源重磅消息!多模态生成再升级,2K高清音画如何颠覆行业?8 月 3 日,人工智能企业 MiniMa ...
MiniMax开源H3模型太赞啦!多模态融合、2K高清输出,架构设计精妙,降低应用门槛,为行业发展注入强大动力!
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部