"""
LLM-based Agents 研究现状与展望
1. LLM-based Agents 概述
1.1 LLM-based Agents 定义
1.1.1 智能代理概念
- 智能代理起源于哲学,描述了一种拥有欲望、信念、意图以及采取行动能力的实体。
- 在人工智能领域,智能代理被赋予了自主性、反应性、积极性和社交能力等特征。
1.1.2 LLM-based Agents 框架
- LLM-based Agents 框架由控制端(Brain)、感知端(Perception)和行动端(Action)三部分组成。
- 控制端由大型语言模型(LLM)构成,负责信息处理、决策等核心功能。
- 感知端将智能代理的感知空间从纯文本拓展到多模态领域,如文本、视觉和听觉。
- 行动端赋予代理具身能力和使用工具的能力,使代理能够与环境交互。
1.2 LLM-based Agents 发展背景
1.2.1 通用人工智能追求
- 长期以来,研究者们一直在追求与人类相当、乃至超越人类水平的通用人工智能(AGI)。
- LLM-based Agents 作为实现 AGI 的潜在途径之一,受到了广泛关注。
1.2.2 大型语言模型推动
- 大型语言模型的出现为智能代理的进一步发展带来了希望。
- LLM-based Agents 结合了语言模型的强大语言理解和生成能力,展现出巨大潜力。
2. LLM-based Agents 工作流程
2.1 LLM-based Agents 应用范式
2.1.1 单代理应用
- 单代理可以接受人类自然语言命令,执行日常任务。
- 应用场景包括任务导向、创新导向和生命周期导向三个层次。
2.1.2 多代理应用
- 多代理系统关注代理们如何有效地协调并协作解决问题。
- 交互形式包括合作型互动和对抗型互动。
2.1.3 人机交互应用
- 人机交互是智能代理通过与人类交互,合作完成任务。
- 交互模式包括Instructor-Executor模式和Equal Partnership模式。
2.2 LLM-based Agents 工作流程示例
- 当人类询问是否会下雨时,感知端将指令转换为LLM可以理解的表示。
- 控制端根据当前天气和互联网上的天气预报进行推理和行动规划。
- 行动端做出响应并将雨伞递给人类,通过反馈与环境交互。
3. LLM-based Agents 应用场景
3.1 单代理应用场景
- 单智能代理的应用可以分为任务导向、创新导向和生命周期导向三个层次。
- 任务导向的应用包括模拟网络环境与模拟生活场景。
- 创新导向的应用体现在前沿科学领域,如化学、材料、计算机等。
- 生命周期导向的应用以《我的世界》游戏为例,展示代理在开放世界中的探索、学习和使用新技能的能力。
3.2 多代理应用场景
- 多代理系统关注代理们如何有效地协调并协作解决问题。
- 协作机制包括无序合作和有序合作。
- 对抗型互动通过竞争、谈判、辩论的形式,提高整个系统的响应质量。
3.3 人机交互应用场景
- 人机交互是智能代理通过与人类交互,合作完成任务。
- 交互模式包括Instructor-Executor模式和Equal Partnership模式。
4. LLM-based Agents 挑战与展望
4.1 挑战
4.1.1 持续学习和记忆
- 智能体在处理任务时,需要开发子问题的解决方案,但经常重复发现过程,导致效率低下。
- 存储子问题及其解决方案需要解决如何识别、评估、依赖关系和表示等问题。
4.1.2 高效编排
- 确定最有效的代理组或工作流来解决任务是一项重要的元任务。
- 工作流设计后,如何有效地路由操作回复空间和跨代理的通信模式是一个挑战。
4.1.3 任务终止条件
- 确定任务完成状态在长时间协作处理任务时具有挑战性。
- 需要探索沟通代理交叉跟踪和任务状态摘要的正确方法。
4.2 展望
4.2.1 智能代理与大语言模型的互相促进
- 大模型在语言理解、决策制定和泛化能力等方面展现出强大潜力,成为代理构建的关键角色。
- 代理的进展为大模型提出了更高要求,促进了大模型的发展。
4.2.2 LLM-based Agents 带来的挑战与隐忧
- 智能代理的安全性评估至关重要,避免对真实世界造成危害。
- 非法滥用、失业风险和对人类福祉的影响等潜在威胁需要引起关注。
4.2.3 代理数量提升的机遇与挑战
- 提升代理数量可以提高模拟可信度与真实性,但通信与消息传播问题也会变得复杂。
4.2.4 LLM-based Agents 是否是通向 AGI 的合适道路
- 有观点认为,以 GPT-4 为代表的大模型在足够的语料上进行了训练,有望成为打开 AGI 之门的钥匙。
- 也有观点认为,自回归语言建模并不能显现真正的智能,世界模型才是通向 AGI 的正确途径。
4.2.5 群体智能的演化历程
- 群体智能是一种集结众人的意见转化为决策的过程。
- 增加代理数量并不一定产生真正的智能,需要协调单个代理,克服团体迷思和个人认知偏差。
4.2.6 代理即服务(AaaS)
- 由于 LLM-based Agents 比大模型本身更加复杂,中小型企业或个人难以在本地构建。
- 云厂商可以考虑以服务的形式提供智能代理,即 Agent-as-a-Service。 """




