什么是 AI Agent 记忆层
Agent 记忆层是 Agent 运行时的持久中间件:从对话与 tool 输出抽取事实、外部存储、在后续轮次按语义/图/时间过滤检索。不同于消费者 PKM(个人第二大脑)或平台内置聊天记忆,它是带 scope 与审计 API 的开发者基础设施。企业静态文档 RAG 见 企业知识库(knowledge-base)选型指南。
百万 token 上下文窗口不能替代外部记忆。全量历史导致 context rot、线性推理成本与会话间 stale 状态。生产 Agent 把窗口当 working set,记忆层存偏好、程序性知识、已解决事件——按需检索注入。
记忆常以 memory_* MCP 工具与 Agent Skills 并存。执行隔离在 Agent 沙箱;记忆是跨会话工作流所需的持久 substrate。
2026 年 Mem0、LongMemEval 等基准显示 selective memory 可能降低 p95 延迟与 token 成本——须在自家多租户 golden query 上验证,勿盲信厂商平均值。
Agent 记忆层是如何工作的
Agent 记忆是 write → store → retrieve,区别于静态文档 RAG。 写入:LLM 抽取候选事实;去重;冲突消解处理被覆盖陈述。 存储:向量(Mem0、Supermemory);时序图(Zep Graphiti);分层 core/archival/recall(Letta);图+向量(Cognee)。 检索:编码 Agent 默认 BM25+向量+rerank。时序过滤回答合规场景下事实有效期。 治理:user/session/agent/team scope 防跨租户泄漏;企业版加保留 API 与审计日志。
- 降 token 与延迟: 相对塞满 history,选择性记忆可显著降低 p95 延迟与推理成本——以 vendor benchmark 为参考,生产须自测。
- 可移植与可治理: 第三方 layer 可换模型、设 retention、审计读取——优于平台内置 Memory 黑箱。
- Scoped memory: user/session/agent/team 作用域是多租户 SaaS 必备——避免记忆泄漏。
- Hybrid 检索: 错误码、路径、版本号靠 BM25;语义靠向量——纯向量在生产易翻车。
薄 layer(Mem0 API)接现有框架 vs 厚运行时(Letta)vs 编码 harness(claude-mem)vs Markdown 文件(OpenClaw MEMORY.md)——成本与可扩展性成反比。
2026 年最好的通用 Agent 记忆层
框架无关的 memory layer——Mem0、Zep、Letta、Supermemory API、Cognee 覆盖向量、时序图谱与图原生控制平面。
1. Mem0: 框架无关记忆层标杆

Mem0 Mem0 是 2026 年 GitHub 社区最大的 Agent 记忆层之一(~59k stars):托管 Platform + Apache-2.0 OSS,提供 extract→consolidate→retrieve 管线、user/session/agent 作用域与 MCP 工具。公开 benchmark 叙事强调相对 full-context 可显著降 token 与延迟——但须用自有 golden set 验证。适合「薄 memory layer + 任意 Agent 框架」的平台团队。
2. Zep / Graphiti: 时序知识图谱记忆

Zep / Graphiti Zep 以 Graphiti 时序知识图谱为核心——追踪事实何时为真、何时被更新,在 LongMemEval temporal 子项上是 2026 年选型分水岭。Cloud 托管 + Graphiti OSS 自托管。适合金融、合规、医疗等需要「去年信 X、今年信 Y」可追溯的场景,而非纯语义相似检索。
3. Letta: MemGPT 有状态 Agent 运行时

Letta Letta(原 MemGPT)把记忆当作 Agent 运行时一等公民——core / archival / recall 分层,而非外挂向量库。开源可自托管,Letta Cloud 按量。适合长运行、多步任务 Agent 需要 OS 式记忆调度,而非只给现有 chatbot 加 retrieve API。
4. Supermemory API: 记忆 API + MCP

Supermemory API Supermemory Memory API(区别于 Supermemory App 个人第二大脑)面向开发者:memory ops API、MCP `memory_*` 工具、LongMemEval 自报领先。托管 + 自托管选项。与 AI 记忆工具页的 Supermemory App 分流——API 买家是 Agent 工程师。
5. Cognee: 图原生记忆控制平面

Cognee Cognee 统一图、向量与关系检索——把记忆当作可治理的控制平面,而非单一向量黑箱。开源为主,适合已投入图数据库或需要 explainable retrieval 的团队。与 Mem0 的「最快上手 API」路线不同,Cognee 偏数据架构师买家。
2026 年最好的编码 Agent 记忆
IDE/CLI 侧记忆——记录会话、决策与文件变更。极简 Markdown 起步见 OpenClaw 替代方案中的 MEMORY.md 模式。
1. claude-mem: Claude Code 会话记忆

claude-mem claude-mem 是面向 Claude Code 的开源会话记忆插件——记录决策、文件变更与跨会话上下文,绑定 IDE harness 而非通用 SaaS API。适合个人开发者已在 Claude Code 工作流、希望零成本起步的记忆方案。
2. agentmemory: 混合检索 MCP 记忆

agentmemory agentmemory 面向 Cursor 等编码 Agent:向量 + BM25(FTS5)混合检索,通过 MCP 暴露——2026 年 coding agent 记忆标配路线。开源本地运行,与 Mem0 等通用 layer 交叉但买家是「我在 IDE 里写代码」而非「我搭 Agent 平台」。
Agent 记忆层工具对比
含中国生态 MemOS、MemU——与主榜通用层对照,帮助全球化与本地化团队并行评估:
| 工具名称 | 核心特点 | 主要应用场景 | 定价模式 |
|---|---|---|---|
| Mem0 | 向量+可选图、MCP、scoped | 通用 Agent 平台 | 免费 + $19/月 Pro |
| Zep | 时序图谱 Graphiti | 合规/金融时序事实 | $25/月 Team 起 |
| Letta | MemGPT 分层运行时 | 长运行 Agent | OSS + Cloud 按量 |
| Supermemory API | Memory API + MCP | MCP Agent 栈 | 免费 credits + 按量 |
| Cognee | 图+向量控制平面 | 可解释检索 | 开源 |
| claude-mem | Claude Code 会话 | IDE harness | 开源 |
| MemOS | MemCube、记忆 OS、治理 | 中国企业可审计记忆 | 开源 + 企业定制 |
| MemU | Memory as FS、proactive | 中文陪伴 Agent | API 按量 |
Agent 记忆都能做什么:4 大实用场景
个性化助手
助手跨会话记住饮食限制、时区、输出格式与项目上下文。Mem0 或 Supermemory API 介于 UI 与任意 LLM 之间——换模型后事实仍在。按 user_id scope;无 team scope 勿共享检索池。
编码 Agent 长期上下文
编码 Agent 回忆 bug 修复、相关文件与架构决策。claude-mem 记录 Claude Code 会话;agentmemory 为 Cursor 加 hybrid MCP;Mem0 MCP 跨 IDE 通用。黄金任务评测数据集见 ai-training-data 训练数据指南。托管 API 前可先用 MEMORY.md。
企业多租户 Agent
多租户 Agent 需保留策略、删除 API 与审计。Mem0 Enterprise、Zep Cloud 面向 GDPR 可证明擦除的场景。
中文陪伴/proactive
中文 proactive 伴侣可评估 MemOS MemCube 与 MemU 文件系统模式——与西方 Mem0/Zep 部署假设分开看。
如何选择 Agent 记忆层
Agent 记忆层选型要先分清买家场景——交互记忆中间件、企业 Wiki RAG 与个人 PKM 不可混评。固定 golden query set,再比 hit@k、部署形态与删除/审计能力。
1. 定买家与数据源
交互记忆 layer 从对话与工具输出中提取动态事实,带 user/session scope,服务 Agent 平台。企业 Wiki RAG 检索静态上传文档;个人 PKM 面向消费级第二大脑——三者采购问题、合规路径与验收指标不同,不可在同一对比表里混评。先写清你的记忆来自哪里、谁有权读写、是否需要跨会话持久化。
2. 选检索范式
语义相似与快速集成偏 Mem0、Supermemory;需要「何时为真」与时序事实图谱偏 Zep/Graphiti;实体关系与多跳推理偏 Cognee 类图记忆。用 LongMemEval 的 temporal 子集或自有 query set 在候选栈上测 hit@k——不要仅凭 GitHub star 或 demo 视频选型。
3. 定部署模型
最少运维选 Cloud API(Mem0、Zep Cloud、Supermemory API);数据主权与 air-gap 选 OSS 自托管(Letta、Cognee、Graphiti)。企业多租户场景须提前确认:retention API、导出、审计日志,以及向量删除是否可证明有效——GDPR 擦除需求不可事后补。
4. Coding 工作流
已在 Claude Code/Cursor 生态可先试 claude-mem 或 agentmemory,以最低集成成本验证「会话记忆是否值得产品化」。需要跨 IDE 统一记忆层时迁移到 Mem0 MCP。极简起步可用 OpenClaw 的 MEMORY.md 模式——适合单人脚本,不适合多租户生产。
5. 用 golden set 评测
用 LongMemEval/LoCoMo 子集或自有 golden query 测 hit@k 与延迟——结合 Agent 沙箱做端到端回归,模拟工具调用与多轮对话后的检索质量。记录 p50/p95 延迟与 token 成本,避免 demo 环境下「检索很准、生产很慢」的落差。
结论
Agent 记忆是 2026 生产基础设施——Mem0、Zep、Letta、Supermemory、Cognee 检索范式不同;按自家模式 benchmark 再选。
个人 PKM → AI 记忆工具专页;企业 wiki RAG → 知识库专页;编码 Agent 从 claude-mem 或 MEMORY.md 起步,跨 IDE 可扩展 Mem0 MCP。
用 LongMemEval 或自定义 golden hit@k 评估——配合 Agent 沙箱做端到端回归。
跨职能评审(工程、内容、法务)可避免可预防的回归:模板变更应触发自动化 HTML 校验、schema 差异检查,并在全量发布前对 flagship URL 抽样人工 QA。将此类页面视为活文档——在快速迭代的 Agent 生态中,按季度刷新,与产品命名、定价及协议变更对齐。
参考文献
- Mem0: ECAI 2025 — Memory Layer Benchmarks (arXiv,2025年) — Latency/token versus full-context baselines.
- Zep: Temporal Knowledge Graph (arXiv,2025年) — Graphiti temporal memory architecture.
- LongMemEval Benchmark (ICLR 2025,2025年) — Long-horizon memory evaluation for agents.
