具身智能学习笔记:智能体需要怎样的记忆系统

1013 字
5 分钟
具身智能学习笔记:智能体需要怎样的记忆系统

语言模型面对的大多是离散文本,而具身智能体面对的是持续变化的环境。摄像头、传感器、动作反馈和任务指令会不断产生新信息,智能体既不能保存并反复读取全部原始观测,也不能只依赖当前一帧做决定。

因此,具身智能中的记忆问题,本质上是:怎样把连续经验整理成可用于下一次决策的状态。

1. 当前世界状态不是长期记忆#

智能体首先需要一个可更新的世界状态,例如物体位置、可交互区域、当前任务阶段和最近动作结果。它强调的是“现在相信环境是什么样”,而不是保存完整历史。

世界状态必须处理不确定性。视觉模型识别到桌上有杯子,不代表杯子一直存在;机器人移动后,相机视角变化,旧坐标也可能失效。因此状态应包含观测时间、来源和置信度,并允许新证据覆盖旧判断。

2. 四类记忆承担不同职责#

我倾向于把具身智能体的记忆拆成四类:

  • 工作记忆:当前目标、最近观测、候选动作和短期计划;
  • 情景记忆:一次任务中发生了什么、采取了什么动作、结果如何;
  • 语义记忆:环境中的稳定知识,例如物体属性、空间规则和用户偏好;
  • 技能记忆:可以复用的操作步骤、策略或控制程序。

这几类记忆的写入频率和检索方式不同。工作记忆需要高频更新,情景记忆按任务整理,语义记忆需要去重与冲突处理,技能记忆则应经过验证后再复用。

3. 从原始观测到可检索经验#

一段完整经历可以经过下面的处理链路:

多模态观测 → 状态估计 → 事件切分 → 结果标注
→ 经验摘要 → 建立索引 → 按任务检索

事件切分很重要。连续视频不适合直接作为记忆单元,而“发现杯子”“尝试抓取”“抓取失败”“调整视角后成功”更适合成为可复用的经验片段。

摘要时要保留动作前提和结果,不能只写“成功拿到杯子”。如果缺少物体位置、抓取姿态和失败尝试,下一次检索到的经验很难指导行动。

4. 记忆检索要与当前任务相关#

相似场景不一定需要相同动作。检索条件除了视觉或文本相似度,还应考虑:

  • 当前任务目标;
  • 环境约束与可用工具;
  • 机器人本体能力;
  • 过去经验的成功条件;
  • 记忆是否已经过期。

召回经验后,智能体仍需根据当前状态重新规划,而不能把过去动作序列机械重放。

5. 记忆中的错误会被持续放大#

错误观测如果被写成长期事实,后续规划会不断建立在错误前提上。为此,记忆系统需要:

  • 区分观测、推断和已验证事实;
  • 为易变状态设置有效期;
  • 保存冲突信息而不是静默覆盖;
  • 允许执行反馈修正已有记忆;
  • 对高风险技能保留人工确认或仿真验证。

6. 我关注的工程问题#

具身记忆并不只是选择向量数据库。真正困难的是决定写什么、何时写、谁有权覆盖、怎样检索,以及记忆如何进入规划模型但不占满上下文。

后续实践中,我希望继续关注多模态事件抽取、世界模型更新、经验检索与行动反馈之间的连接,让记忆成为闭环决策的一部分,而不是附加在 Agent 旁边的聊天记录库。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

具身智能学习笔记:智能体需要怎样的记忆系统
https://blog.miansu.eu.cc/posts/embodied-agent-memory/
作者
叶立恒
发布于
2026-06-14
许可协议
CC BY-NC-SA 4.0

评论区