智能评分追平顶尖模型,Qwen3.8 Max重测后表现如何?
评测机构Artificial Analysis近日更新了对Qwen3.8 Max的评估结果。在改用官方API接口重新测试后,该模型的“智能指数”从53分提升至56分,与Claude Opus 4.8的最新成绩持平。不过,它仍以1分之差落后于当前领先的Kimi K3模型。
Agent能力成为最大亮点
此次评分提升的关键在于Agent任务的飞跃。在GDPval-AA这项综合评估中,Qwen3.8 Max拿到了1739分,不仅超越了Kimi K3的1685分,也略微超过了GPT-5.6 Sol的1730分。目前,只有Claude Opus 5在这一项上的得分更高。
除了Agent任务,模型在终端操作、科学推理和编程等多个评测维度上也普遍取得了进步。
性能提升的代价:成本与可靠性问题
更强的能力并非没有成本。尽管Qwen3.8 Max每个Token的单价有所下降,但完成一次综合评测任务的平均花费却从0.53美元大幅增加至1.14美元,高于Kimi K3的0.86美元。
成本上升的主要原因是模型在处理复杂任务时,倾向于进行更多轮的内部调用并生成更长的内容。
更值得关注的是知识可靠性的变化。评测数据显示,模型的幻觉率从上一代的23%急剧上升至40%,这意味着它在回答问题时“编造”事实的可能性显著增加,尽管其基础知识的准确率保持稳定。
对开发者与用户的启示
这次重测结果描绘了一个复杂的图景:
- 能力增强:在需要多步骤规划和执行的Agent任务上,模型表现出强大的竞争力。
- 使用成本:用户需要为更强大的性能支付更高的推理费用。
- 可靠性风险:幻觉率翻倍提醒使用者,在关键事实核查场景中需保持谨慎。
对于考虑集成该模型的企业和开发者来说,需要在任务性能、预算以及对输出准确性的容忍度之间做出权衡。