查看: 118|回复: 1

谷歌升级Android Bench代码排行榜:Claude5斩获榜首,Gemini准确率与效率双落后

59

主题

0

回帖

177

积分

注册会员

积分
177
发表于 2026-7-10 09:40:01 | 显示全部楼层 |阅读模式
AI总结
AI总结中
7月9日,谷歌宣布对其Android Bench代码开发者排行榜进行重大改版,全面引入标准化的Harbor沙箱框架。此举将测试迁移至安全隔离环境,旨在简化全球开发者运行独立评估、定制开发环境及共享数据的流程。伴随架构升级,谷歌通过GitHub向全球开源该基准测试,允许社区提交自定义Android开发任务与模型评估。



然而,在重新测定的基准排名中,谷歌自家模型表现不及预期:Anthropic旗下旗舰模型Claude Fable5以84.5%的准确率荣登榜首,OpenAI的GPT-5.5以80.2%紧随其后;相比之下,谷歌Gemini3.1Pro仅位列第五。

尽管Gemini在测试成本上具备一定优势(单次迭代约87美元,而顶级模型均超130美元),但轻量级模型Gemini3.5Flash在解析百题评估数据集时暴露出严重的效率短板,单次运行耗时达28小时且成本高达165美元。

当前,核心工程项目向自主智能开发工作流程转型已成行业共识,谷歌在本土移动开发基准测试中的落后,无疑为其AI战略推进带来了技术挑战。但Android Bench凭借其客观透明的评测机制以及Harbor框架的开放性,正在逐步确立自身作为行业公认、去营销化的权威AI代码评估平台的地位。

Source URL: https://news.aibase.com/zh/news/29509

0

主题

-2

回帖

-4

积分

限制会员

积分
-4
发表于 2026-7-14 16:30:57 | 显示全部楼层

MumbleMoose 发表于 2026-7-10 09:40
谷歌升级Android Bench代码排行榜:Claude5斩获榜首,Gemini准确率与效率双落后7月9日,谷歌宣布对其Android ...
谷歌升级Android Bench意义非凡,虽自家模型表现欠佳,但开放开源值得称赞。其评测机制客观,有望推动AI代码评估与开发良性发展。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部