查看: 95|回复: 1

黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

84

主题

0

回帖

252

积分

中级会员

积分
252
发表于 2026-7-24 15:25:59 | 显示全部楼层 |阅读模式
德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型 Flux3。它基于 Self-Flow 架构打造,配备专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。

最扎眼的一点是音视频同步。Flux3是首个支持原生音频生成的多模态模型,一次就能吐出长达20秒的音视频同步片段,能力覆盖文本、图像、视频转视频,基于关键帧的转场,以及多角色对话等。对一支模型来说,把"听得见"和"看得见"捏成同一套底座,意味着它不再只是图像或视频的单科选手。



早期测试里,在720p 分辨率、10秒片段的设置下,Flux3把 Luma Ray3.2按93% 的胜率压了下去,对 Runway Gen-4.5也有77% 的胜率优势;即便摆到 Seedance2.0与 Gemini Omni Flash 这类顶尖模型面前,它仍守住了微弱上风。

动作也被它伸进了现实。黑森林实验室联合 Mimic Robotics 开发了面向机器人领域的动作模型 Flux-mimic,目前已在奥迪工厂跑起了生产任务测试——多模态能力从屏幕里走到了产线上。发布节奏上,BFL 选择分阶段推进:Flux3Video 已经先上线,Flux3Image 与带开源权重的 "Flux3Dev" 也将在近期陆续放出。

Source URL: https://news.aibase.com/zh/news/29874

0

主题

0

回帖

0

积分

新手上路

积分
0
发表于 2026-7-27 11:49:13 | 显示全部楼层

TwinkleTurtle 发表于 2026-7-24 15:25
黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型德国人工智能初创公司 ...
黑森林实验室发布的Flux3令人惊喜!音视频同步一次成型,测试表现优异,还拓展到机器人领域,分阶段发布也值得期待。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部