另一关键信号来自开发者社区的实测验证。多名网友发现,部分 DeepSeek V4 相关 API 已能正确回答此前在不联网状态下无法答对的 Claude Opus 4.5、Sonnet 4.5 等模型发布日期。测试均通过 API 而非网页对话进行,且并非所有用户都能复现,这正是灰度测试分批放量的典型特征。
近期 DeepSeek 服务频繁出现不稳定情况,也从侧面印证了团队正不断小范围测试并撤回修改,为全面推送打磨稳定性。从 7 月中旬至今,一个月的时间里 DeepSeek 持续迭代,外界期待正式版的性能至少能达到 GLM 5.2 与 Claude Opus 4.8 之间的水平。