现在智能体基本都遵循了 React 架构:首先获取一个 observation(观察),然后基于这个 observation 进行 reasoning,也就是模型的思考。在模型思考之后,会输出一个 action(动作),这个 action 通常就是模型与外部环境交互的接口,大多数情况下是工具的使用。
这种架构非常流行,以至于我们常常认为这就是 agent 的标准架构。但其实,agent 的架构还可以有其他视角。例如,有一种方案认为,agent 的 reasoning 也可以看作是一种 reaction,而所有的 action 都可以理解为对工具的使用。工具分为两类:一类是外部工具,也就是 agent 本身无法完成输入输出过程时需要调用的工具;另一类是内部工具,也就是各种 reasoning 的方法。
通过这种方式,agent 的架构可以分为工具的使用和对工具的选择,也就是工具决策。这样一来,agent 的智能水平不仅取决于它对知识的掌握,还取决于它在不同场景下如何做工具使用决策的能力。
这种能力不仅包括对工具的理解,更重要的是对自身知识的认知。Agent 需要判断,当前的问题是需要调用外部工具,还是使用内部工具进行推理。这实际上就是明确自身知识的边界。
从这个视角来看,Agent 自身能力的提升可以分为两个方面。对于如何训练和研究更有广泛能力的 Agent,也会衍生出新的方向和侧重点。这为我们提供了一种学术上的方法论:可以从底层定义出发,对当前规范进行不同的解读,并在此基础上发展出新的研究脉络。
这种底层解读往往有不同的侧重点,能够自然引申出新的理论和研究方向。而由此生长出来的研究是否具有影响力和意义,关键在于所开辟的底层观念是否足够坚实、合理。