查看: 78|回复: 0

全模态视频模型迎来新突破:MiniMax正式发布H3 并承诺开源权重

73

主题

0

回帖

219

积分

中级会员

积分
219
发表于 2026-7-31 11:45:13 | 显示全部楼层 |阅读模式
AI总结
AI总结中
在文本大模型领域持续发力之后,人工智能企业 MiniMax 于近日正式推出了全新的全模态生成模型MiniMax H3,并向行业承诺将在几天内全面开源模型权重。

作为一款支持多模态上下文输入的生成模型,MiniMax H3能够同时接收文本、图像、视频以及声音的任意组合作为输入,并最终输出带有原生双声道音频的高清视频。在实际应用中,用户只需向模型提供参考视频、图片或音频素材,并结合自然语言指令,即可一气呵成完成复杂的视听内容创作。



在技术架构上,MiniMax H3彻底打破了传统多模态模型按任务拆分专家模型的做法。研发团队将文生图、文生视频、图到视频以及音频处理等多种任务全部整合进同一个预训练框架中,推出了更简洁的 H3-Omni Transformer 架构,使端到端训练吞吐量提升了近30%。同时,通过重写 Tokenizer 带来的 H3-VAE 架构,实现了极高的压缩率,有效降低了高分辨率下的推理成本。

在定价与生态方面,MiniMax H3在2K 分辨率下的每秒价格不到主流同类模型的三分之一,同时在设计初期便充分考虑了对国产芯片的兼容性。目前,该模型在电影片头、游戏 UI 动画、动态海报以及广告电商等场景中展现出广阔的应用潜力,其对文字渲染和品牌信息呈现的准确度也得到了显著提升。

Source URL: https://news.aibase.com/zh/news/30033
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部