判断 1
模型是发动机,系统才是整辆车
我过去常把模型能力看成智能体的主要上限:模型越强,能做的事越多。但现在这个判断已经不够用了。一个模型即使具备解决单步问题的能力,也可能因为忘记中间状态、重复犯错、调用了不合适的工具,或者在长任务中提前结束而失败。相反,一个并非最强的模型,只要被放进更好的执行框架里,就可能稳定完成更复杂的工作。
这意味着所谓“智能”正在被拆成两部分:模型负责理解和生成,系统负责记住、安排、验证和恢复。后四项听起来不像突破,却更接近真实工作。普通用户在对话框里感受到的是答案质量,企业和开发者真正要承担的,却是任务能不能连续运行、出错后能不能回到正确状态,以及成本是否可控。
判断 2
记忆不是越多越好,而是越有用越好
智能体记忆尤其容易被误解。把所有历史经验都塞回上下文,并不会自动带来更高的能力;信息过多反而可能增加成本,干扰当前任务。更有效的方向,是只提取与当前问题有关的经验,并以合适的粒度交给模型。
我认为这会改变产品设计的重点。未来值得比较的,不只是模型的单轮回答,而是它能否形成可检查的工作记忆:哪些经验被保存,为什么被调用,什么时候应该遗忘,用户能否修正。记忆如果不可见,智能体就很难被信任;如果不可控,它也很难真正进入重要工作流。