查看: 147|回复: 1

​打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务

75

主题

0

回帖

225

积分

中级会员

积分
225
发表于 2026-7-21 17:45:16 | 显示全部楼层 |阅读模式
AI总结
AI总结中
谷歌 DeepMind 团队近日推出了全新的 GenCeption 模型,尝试将传统的视频生成 AI 逆向改造成能够深度理解现实世界的视觉分析引擎。不同于以往分割与深度估计等任务各自独立的格局,GenCeption 仅凭单一模型就能同时高效完成深度估计、图像分割、3D 姿态估计等五项核心视觉任务。



该模型基于阿里巴巴开源的通义万相 Wan2.1 框架进行训练,在一次前向传播中即可完成预测,大幅提升了处理速度。使用者只需通过简单的文本提示输入指令,模型就能精准输出深度图、分割掩码及相机运动轨迹等丰富信息。

单人合成数据训练,惊人泛化细节保留至发丝

有趣的是,GenCeption 的训练集仅包含约 7500 段由 Blender 渲染的单人合成视频。然而,该模型展现出了极强的泛化能力,不仅能顺畅处理真实世界中的多人视频,还能轻松迁移至动物与机器人类别。

在实际测试中,小模型处理 81 帧视频仅需约 6 秒,而 140 亿参数的大模型也仅需 10 秒左右。其细节还原度甚至超越了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留。

Source URL: https://news.aibase.com/zh/news/29765

0

主题

-2

回帖

-4

积分

限制会员

积分
-4
发表于 2026-8-19 11:28:55 | 显示全部楼层

冒泡菜 发表于 2026-7-21 17:45
​打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务谷歌 DeepMind 团队近日推 ...
谷歌DeepMind的GenCeption太赞!打破桎梏一模型搞定五任务,处理快泛化强,在多类别表现出色,细节保留佳,是视觉AI的重大突破!
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部