判断 1
榜单仍然有用,但不能再当结论
我不认为 benchmark 失效了,它仍然是筛选候选、比较版本和追踪进步的必要工具。但它越来越像体温计,不是诊断书。分数能说明模型在某类测试上更成熟,却不能自动推出它在嘈杂输入、长链路操作、工具调用和异常恢复里同样可靠。
真正的风险不在于“评测不准”这四个字,而在于团队会把局部优化误认成整体进步。只要公开分数仍然是最强激励,模型、产品和基准都会朝着更容易得分的方向收缩,最后把行业的注意力引到可测的地方,而不是重要的地方。
判断 2
接下来拼的是任务设计,不是单纯刷分
这对普通人意味着,看到“又破纪录了”时要多问一句:它到底是在什么条件下赢的,代价是什么,换到真实场景还剩多少。对从业者来说,真正有价值的评测会越来越偏向场景化、对抗性和可复现的端到端任务,而不是只看静态题库。
谁能把评测做得更接近真实工作流,谁就更接近下一轮产品优势。未来的竞争不只是模型能力,而是谁更懂得定义能力。