判断 1
第一,排行榜正在失去单独决策的资格
我不认为公开基准会立刻失去价值。它们仍然适合观察趋势、发现明显退步,也能让不同系统在相同规则下比较。但当模型开发者长期围绕固定题目和固定评分方式优化时,分数测到的就不再只是能力,还包括对考题分布的熟悉程度。
这意味着产品团队不能再用一个漂亮的榜单分数替代上线判断。语音助手要在口音、噪声和真实对话中稳定工作,代码智能体要能处理模糊需求和失败重试,科学智能体则要面对不知道答案的情况。真正有用的评测,必须尽量接近这些工作现场。
判断 2
第二,未来的竞争是“谁更会证明自己可靠”
我更在意的变化,不是又多了多少分,而是评测正在从一次考试变成持续的工程系统。测试集需要更新,评分需要人工复核,任务需要覆盖不同环境,还要观察模型是否只是记住了评测规律。对智能体来说,记忆、工具调用、上下文压缩和工作流程都可能改变结果,因此模型、提示词、工具和评测 harness 不能被拆开看。
这会抬高 AI 产品的门槛,却也给普通团队留下机会:没有最大模型的团队,仍然可以靠更贴近业务的测试、更清楚的失败定义和更可靠的人工验收,做出用户真正愿意信任的系统。