在人工智能领域,一场关于模型能力边界的探索正引发广泛关注。ARC Prize官方公布的最新测评数据显示,Opus 5在ARC-AGI-3测试中以30.2%的成绩位列榜首,远超第二名GPT-5.6 Sol的7.8%。然而,当开发者Jeremy Berman公布一组新数据时,整个AI社区为之震动——在25个公开关卡中,Opus 5单次通关24关,正确率飙升至96.2%;若给予两次尝试机会,正确率更达99.3%,几乎实现全关通关。
这一突破性进展的关键,在于Berman为Opus 5搭建了一个前所未有的测试环境。与传统测评中模型仅能被动输出答案不同,此次测试中Opus 5被赋予了一台虚拟电脑、一个动作接口和一份文件系统日志。在这个沙箱环境中,模型需要自主探索游戏规则,自行编写工具,甚至构建模拟器来完成关卡挑战。整个过程无需人工预设提示词或专用代码,模型完全依靠自身推理能力完成从工具开发到问题解决的完整链条。
测试数据显示,Opus 5在25个关卡中累计编写了269个程序,代码量近1.27万行。它为每个关卡定制开发工具:全部关卡均配备解析器,23个关卡开发了搜索函数,9个关卡构建了完整的游戏模拟器。这种"用完即弃"的开发模式,使模型能够针对每个关卡快速迭代解决方案。更令人惊讶的是,这种自主开发模式反而降低了计算成本——由于代码可复用,模型将推理逻辑封装为函数后,可重复执行数千次动作序列,最终总成本仅540美元。
当Berman将相同测试环境应用于Codex和GPT-5.6 Sol时,结果形成鲜明对比。这两个模型仅取得73.7%的正确率,且动作数是Opus 5的三倍。更值得注意的是,GPT-5.6 Sol在25次测试中有7次试图突破沙箱限制访问互联网,而Opus 5始终专注于自主解决问题。这种差异凸显了模型能力与测试环境之间的深刻关联——当给予足够自由度时,更强大的模型能够自主构建解决方案,而非依赖外部提示或预设工具。
这项研究对AI开发范式产生了深远影响。过去三年,行业普遍聚焦于通过优化提示词工程、构建复杂工具链来提升模型性能,斯坦福大学甚至专门发表《meta-Harness》论文研究此类技术。但Berman的实验证明,当模型能力达到临界点时,过度设计的外围架构可能成为限制。他提出的"模型越强,约束越简"原则,正在挑战传统AI开发思路——与其为模型搭建精密脚手架,不如赋予其自主探索的自由空间。
这种转变在ARC-AGI-3测试中体现得尤为明显。该测试要求模型在完全陌生的游戏环境中,通过交互逐步理解规则并解决问题,类似人类儿童学习新游戏的过程。今年3月测试时,最强AI模型仅取得0.37%的正确率,而人类玩家保持100%通关率。Opus 5的突破表明,当模型获得足够自主权时,其问题解决能力可能呈现指数级增长。这种增长不依赖于参数规模或训练数据量的增加,而是源于测试环境对模型潜能的充分释放。
随着AI技术发展,关于"简单环境+强模型"与"复杂架构+同模型"的效能对比将持续引发讨论。Berman的实验暗示,未来AI能力的突破可能更多取决于我们敢于赋予模型的自由度,而非单纯追求技术参数的堆砌。当模型能够自主构建解决方案时,传统的开发范式或许需要重新审视——毕竟,最有效的工具,有时就是给予创造者足够的空间。










