编程基准测试迎来4.0时代,评估体系全面升级
备受关注的AI代码能力基准测试Terminal-Bench近日发布了其4.0版本。这次更新并非简单的迭代,而是对核心评估机制进行了一次深度校准。项目团队重点调整了智能体(Agent)在执行任务时的资源消耗度量标准,包括时间、CPU和内存占用,旨在更真实地反映模型在实际开发环境中的表现。
更纯净的赛场:任务库与规则优化
为了提升榜单的公信力与参考价值,4.0版本对任务库进行了大幅清理。团队修复了19个存在评估偏差的任务,同时移除了8个因出现饱和现象、模型频繁拒答、存在公开解决方案或本身质量存疑的任务。所有测试任务的执行时间上限被统一设定为8小时,这一举措主要为了减少因超时或环境配置问题导致的意外失分,让模型的真实代码能力成为决定性因素。
最新榜单出炉,头部竞争格局生变
在新的评估体系下,最新一期排行榜结果已经公布,呈现出一些值得玩味的变化。
冠亚军稳固,季军易主
Opus5与ClaudeCode的组合以51.8%的得分率稳居第一,Fable5以44.5%的成绩位列第二,头部两强的地位依然稳固。真正的看点出现在第三名的争夺上。
GLM-5.3实现逆袭,成为最大黑马
GLM-5.3模型在适配ClaudeCode后,取得了41.8%的得分率,成功冲至榜单第三位。这一成绩使得它超越了由GPT-5.6Sol与Codex组合取得的37.3%得分率。尤为引人注目的是,在榜单前三甲中,GLM-5.3是唯一一个并非由Anthropic公司开发的模型,打破了该领域头部梯队原有的品牌格局。
从追赶者到超越者:GLM-5.3的进化之路
对比两个版本的榜单,可以清晰看到GLM-5.3的进步轨迹。在Terminal-Bench 3.0版本中,该模型的得分率为32.4%,当时排在第四位,落后于GPT-5.6Sol的34.6%。然而,在升级到4.0评估标准后,GLM-5.3不仅排名上升至第三,更实现了对GPT-5.6Sol的反超,领先优势达到4.5个百分点。这一跨越式的表现,显示出其在代码生成与理解能力上的实质性提升。
这次Terminal-Bench 4.0的发布与榜单更新,为开发者与研究者提供了评估AI编程助手能力的新标尺,也预示着大模型在代码领域的竞争将更加激烈和多元化。