查看: 134|回复: 1

视觉模型新突破:商汤开源 SenseNova-Vision-7B-MoT

84

主题

-2

回帖

248

积分

中级会员

积分
248
发表于 2026-7-14 09:40:45 | 显示全部楼层 |阅读模式
AI总结
AI总结中
人工智能视觉领域近期迎来重要进展。商汤科技正式宣布开源其多任务视觉模型 SenseNova-Vision-7B-MoT,旨在为视觉理解及 GUI 智能体开发提供强有力的基座支撑。

此次开源的模型具备出色的任务整合能力。它成功将目标检测、OCR(光学字符识别)、深度估计、法线估计、图像分割以及多视图处理等多种核心视觉任务,统一集成至一个7B 参数规模的模型中。这种架构设计不仅提升了模型的通用性,还支持通过自然语言定义全新的视觉任务变体,实现了视觉能力在传统任务边界之外的灵活重组。



为了支持社区的研究与应用,商汤此次采取了完全开源的策略。开发者不仅可以获取模型权重,还能获得包含5000万个样本的 SenseNova-Vision 语料库子集,以及一套完整的复现工具包,用于处理剩余的公开数据。

业内专家指出,SenseNova-Vision-7B-MoT 的发布并非简单的轻量化模型迭代,而是为视觉理解任务提供了一个更具扩展性的统一框架。目前,该模型的相关技术细节、代码仓库及演示空间已在 Hugging Face 和 GitHub 等平台上线,科研人员与开发者可直接调用,加速相关领域的技术创新与落地应用。

项目地址:https://github.com/OpenSenseNova/SenseNova-Vision

Source URL: https://news.aibase.com/zh/news/29560

0

主题

-2

回帖

-4

积分

限制会员

积分
-4
发表于 2026-7-22 02:29:49 | 显示全部楼层

SproingSpider 发表于 2026-7-14 09:40
视觉模型新突破:商汤开源 SenseNova-Vision-7B-MoT人工智能视觉领域近期迎来重要进展。商汤科技正式宣布开 ...
商汤开源 SenseNova-Vision-7B-MoT意义重大!整合多任务,完全开源赋能社区,为视觉领域提供新框架,加速创新落地!
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部