判断 1
从“生成能力”转向“交付闭环”
我认为这是 Agent 发展中一个容易被低估的转折。过去,人们常用模型能否写出一段代码、答对一道题来衡量能力;但当 Agent 开始操作终端、修改仓库、接入工业项目时,真正重要的是它能否理解上下文,改变正确的状态,并接受独立检查。生成只是动作,验证后的结果才是产出。
这也解释了为什么环境设计和评测设计会变得重要。一个静态、容易猜答案的环境,会让 Agent 看起来很强,却无法暴露它在边界条件、依赖关系和状态变化上的缺陷。能根据弱点调整环境、同时保证任务本身可解且评判一致,可能比再增加一轮表面上的基准分数更有价值。
判断 2
“完成”不能由 Agent 自己宣布
第二个判断更实际:只要 Agent 的工作结果会进入真实系统,完成标准就必须从模型内部移到系统外部。让模型自己判断“已经足够好”,在开放式写作里或许还能接受,在科学代码、工业控制和复杂终端任务里就不够了。编译、测试、规格检查、状态验证和操作日志,构成了最低限度的信任边界。
这并不意味着模型不重要,而是模型的能力必须嵌入一个能观察、纠错和拒绝错误结果的流程。未来更有竞争力的 Agent,未必是单次回答最漂亮的那个,而是能在失败后获得清晰反馈,继续行动,并最终留下可复核证据的那个。