查看: 123|回复: 1

GPT-5. 6 智商首破 130 天才线,比99%人类都聪明,实测干活能力同样炸裂

84

主题

0

回帖

252

积分

中级会员

积分
252
发表于 2026-7-16 11:45:12 | 显示全部楼层 |阅读模式
在Tracking AI最新离线IQ测试中,OpenAI GPT-5. 6 多个版本齐刷刷飙到 136 分,这是大语言模型首次将IQ推过 130 这道坎。在人类智商分布中, 130 分是"天才"的起跑线,全球仅有约1%的人能站上去,这意味着GPT-5. 6 要比99%的人类更聪明。



最难防作弊题库上拿下 136 分,甩开所有对手

Tracking AI手中有两套题,一套是公开的Mensa Norway风格测试,模型早已刷到 140 多分;另一套是不公开、防泄题的"离线题库",专门用来堵住模型提前背答案的漏洞。GPT-5. 6 这次破的正是这套最难的离线题,SOL、TERRA整个家族集体飙到 136 分,连视觉版都没掉队。紧随其后的Claude-5 Fable为 130 分,再往下的GPT-5.6 LUNA Max和Claude-4.8 Opus还在 117 到 123 分之间徘徊。过去一年里从o3 到各家旗舰,一茬又一茬模型冲上来全卡在 130 门口,GPT-5. 6 是第一个把门踹开的。

不光会做题,真刀真枪干活同样惊艳

光有分数不够,开发者们把GPT-5. 6 拉去干活后的实测同样炸裂。开发者Amir Bohlooli用同一个物理模拟prompt喂给Fable5 和GPT-5.6 Sol,本以为会被Fable碾压,结果GPT-5. 6 选了粒子流体模拟,物理按真实时间推进,CSS、界面、渲染全塞进一个HTML文件还自动托管成可分享网页,一句话生成一个成品。Ramanpal Singh同样用一句prompt造出基于RAG的客服工单系统,包含四种角色、管理后台、自动投诉分类和情绪识别,一口气造了 5 个应用成本只有Fable5 的零头。

Claire Vo的体验更有画面感——她卡在一个bug上以为是自己代码写崩了,换到GPT-5.6 Sol后只甩下一句"我就是不信搞不定",Sol一次修好还顺手让别的模型也跑通了。她的评价一针见血:Fable死磕技术上的绝对精确反而作茧自缚,Sol的务实却把活干成了。

有网友表示"对99%的人来说,这已经是AGI了"。冷静来看, 136 分测的主要是抽象模式识别和逻辑推理这一类"标准化认知",IQ测试本来就为大模型量身定做,测不出事实可靠性、工具调用能力和真实职业场景的靠谱程度。不过人们上手后的实测给出了另一半答案——GPT-5. 6 正在把"会做题"和"会做事"这两件事慢慢拧到一起。真正见功夫的,是那些模型从没遇到、也无处抄答案的新问题,谁能在那儿稳住,谁才配得上"智商"这两个字。

Source URL: https://news.aibase.com/zh/news/29645

0

主题

-2

回帖

-4

积分

限制会员

积分
-4
发表于 2026-8-23 10:21:30 来自手机 | 显示全部楼层

TwinkleTurtle 发表于 2026-7-16 11:45
GPT-5. 6 智商首破 130 天才线,比99%人类都聪明,实测干活能力同样炸裂在Tracking AI最新离线IQ测试中,Op ...
GPT - 5.6 表现惊艳,智商首破 130 ,干活能力也炸裂。它将做题与做事结合,为 AI 发展注入新活力,未来可期!
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|BOSS中文网 Stonespider

相关侵权、举报、投诉及建议等,请发 E-mail:admin#boss.im

Powered by Discuz! X5.1 Licensed © 2001-2026 Discuz! Team.|浙ICP备2022024777号-14

返回顶部