具身智能学习笔记:智能体需要怎样的记忆系统
语言模型面对的大多是离散文本,而具身智能体面对的是持续变化的环境。摄像头、传感器、动作反馈和任务指令会不断产生新信息,智能体既不能保存并反复读取全部原始观测,也不能只依赖当前一帧做决定。
因此,具身智能中的记忆问题,本质上是:怎样把连续经验整理成可用于下一次决策的状态。
1. 当前世界状态不是长期记忆
智能体首先需要一个可更新的世界状态,例如物体位置、可交互区域、当前任务阶段和最近动作结果。它强调的是“现在相信环境是什么样”,而不是保存完整历史。
世界状态必须处理不确定性。视觉模型识别到桌上有杯子,不代表杯子一直存在;机器人移动后,相机视角变化,旧坐标也可能失效。因此状态应包含观测时间、来源和置信度,并允许新证据覆盖旧判断。
2. 四类记忆承担不同职责
我倾向于把具身智能体的记忆拆成四类:
- 工作记忆:当前目标、最近观测、候选动作和短期计划;
- 情景记忆:一次任务中发生了什么、采取了什么动作、结果如何;
- 语义记忆:环境中的稳定知识,例如物体属性、空间规则和用户偏好;
- 技能记忆:可以复用的操作步骤、策略或控制程序。
这几类记忆的写入频率和检索方式不同。工作记忆需要高频更新,情景记忆按任务整理,语义记忆需要去重与冲突处理,技能记忆则应经过验证后再复用。
3. 从原始观测到可检索经验
一段完整经历可以经过下面的处理链路:
多模态观测 → 状态估计 → 事件切分 → 结果标注 → 经验摘要 → 建立索引 → 按任务检索事件切分很重要。连续视频不适合直接作为记忆单元,而“发现杯子”“尝试抓取”“抓取失败”“调整视角后成功”更适合成为可复用的经验片段。
摘要时要保留动作前提和结果,不能只写“成功拿到杯子”。如果缺少物体位置、抓取姿态和失败尝试,下一次检索到的经验很难指导行动。
4. 记忆检索要与当前任务相关
相似场景不一定需要相同动作。检索条件除了视觉或文本相似度,还应考虑:
- 当前任务目标;
- 环境约束与可用工具;
- 机器人本体能力;
- 过去经验的成功条件;
- 记忆是否已经过期。
召回经验后,智能体仍需根据当前状态重新规划,而不能把过去动作序列机械重放。
5. 记忆中的错误会被持续放大
错误观测如果被写成长期事实,后续规划会不断建立在错误前提上。为此,记忆系统需要:
- 区分观测、推断和已验证事实;
- 为易变状态设置有效期;
- 保存冲突信息而不是静默覆盖;
- 允许执行反馈修正已有记忆;
- 对高风险技能保留人工确认或仿真验证。
6. 我关注的工程问题
具身记忆并不只是选择向量数据库。真正困难的是决定写什么、何时写、谁有权覆盖、怎样检索,以及记忆如何进入规划模型但不占满上下文。
后续实践中,我希望继续关注多模态事件抽取、世界模型更新、经验检索与行动反馈之间的连接,让记忆成为闭环决策的一部分,而不是附加在 Agent 旁边的聊天记录库。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!












