我做了 Oginify:免费 OG 图片生成器,每天 3 次,无需注册。来试试 →

编码与开发AI智能体与模型

AI Agent 记忆层:跨会话持久化与检索中间件选型

百万 token 窗口不能替代记忆层——Agent 质量瓶颈常是「记不住」或「记错了」。本文对比 Mem0、Zep、Letta、Supermemory API、Cognee 等通用记忆层,以及 claude-mem、agentmemory 等编码 Agent 记忆,帮你在向量、时序图谱与 IDE harness 间选对中间件。

·更新于 2026年6月20日·18 分钟阅读
AI Agent 记忆层:跨会话持久化与检索中间件选型 — hero illustration

什么是 AI Agent 记忆层

Agent 记忆层是 Agent 运行时的持久中间件:从对话与 tool 输出抽取事实、外部存储、在后续轮次按语义/图/时间过滤检索。不同于消费者 PKM(个人第二大脑)或平台内置聊天记忆,它是带 scope 与审计 API 的开发者基础设施。企业静态文档 RAG 见 企业知识库(knowledge-base)选型指南

百万 token 上下文窗口不能替代外部记忆。全量历史导致 context rot、线性推理成本与会话间 stale 状态。生产 Agent 把窗口当 working set,记忆层存偏好、程序性知识、已解决事件——按需检索注入。

记忆常以 memory_* MCP 工具与 Agent Skills 并存。执行隔离在 Agent 沙箱;记忆是跨会话工作流所需的持久 substrate。

2026 年 Mem0、LongMemEval 等基准显示 selective memory 可能降低 p95 延迟与 token 成本——须在自家多租户 golden query 上验证,勿盲信厂商平均值。

Agent 记忆层是如何工作的

Agent 记忆是 write → store → retrieve,区别于静态文档 RAG。 写入:LLM 抽取候选事实;去重;冲突消解处理被覆盖陈述。 存储:向量(Mem0、Supermemory);时序图(Zep Graphiti);分层 core/archival/recall(Letta);图+向量(Cognee)。 检索:编码 Agent 默认 BM25+向量+rerank。时序过滤回答合规场景下事实有效期。 治理:user/session/agent/team scope 防跨租户泄漏;企业版加保留 API 与审计日志。

  • 降 token 与延迟: 相对塞满 history,选择性记忆可显著降低 p95 延迟与推理成本——以 vendor benchmark 为参考,生产须自测。
  • 可移植与可治理: 第三方 layer 可换模型、设 retention、审计读取——优于平台内置 Memory 黑箱。
  • Scoped memory: user/session/agent/team 作用域是多租户 SaaS 必备——避免记忆泄漏。
  • Hybrid 检索: 错误码、路径、版本号靠 BM25;语义靠向量——纯向量在生产易翻车。

薄 layer(Mem0 API)接现有框架 vs 厚运行时(Letta)vs 编码 harness(claude-mem)vs Markdown 文件(OpenClaw MEMORY.md)——成本与可扩展性成反比。

2026 年最好的通用 Agent 记忆层

框架无关的 memory layer——Mem0、Zep、Letta、Supermemory API、Cognee 覆盖向量、时序图谱与图原生控制平面。

1. Mem0: 框架无关记忆层标杆

Mem0 首页截图

Mem0 Mem0 是 2026 年 GitHub 社区最大的 Agent 记忆层之一(~59k stars):托管 Platform + Apache-2.0 OSS,提供 extract→consolidate→retrieve 管线、user/session/agent 作用域与 MCP 工具。公开 benchmark 叙事强调相对 full-context 可显著降 token 与延迟——但须用自有 golden set 验证。适合「薄 memory layer + 任意 Agent 框架」的平台团队。

2. Zep / Graphiti: 时序知识图谱记忆

Zep / Graphiti 首页截图

Zep / Graphiti Zep 以 Graphiti 时序知识图谱为核心——追踪事实何时为真、何时被更新,在 LongMemEval temporal 子项上是 2026 年选型分水岭。Cloud 托管 + Graphiti OSS 自托管。适合金融、合规、医疗等需要「去年信 X、今年信 Y」可追溯的场景,而非纯语义相似检索。

3. Letta: MemGPT 有状态 Agent 运行时

Letta 首页截图

Letta Letta(原 MemGPT)把记忆当作 Agent 运行时一等公民——core / archival / recall 分层,而非外挂向量库。开源可自托管,Letta Cloud 按量。适合长运行、多步任务 Agent 需要 OS 式记忆调度,而非只给现有 chatbot 加 retrieve API。

4. Supermemory API: 记忆 API + MCP

Supermemory API 首页截图

Supermemory API Supermemory Memory API(区别于 Supermemory App 个人第二大脑)面向开发者:memory ops API、MCP `memory_*` 工具、LongMemEval 自报领先。托管 + 自托管选项。与 AI 记忆工具页的 Supermemory App 分流——API 买家是 Agent 工程师。

5. Cognee: 图原生记忆控制平面

Cognee 首页截图

Cognee Cognee 统一图、向量与关系检索——把记忆当作可治理的控制平面,而非单一向量黑箱。开源为主,适合已投入图数据库或需要 explainable retrieval 的团队。与 Mem0 的「最快上手 API」路线不同,Cognee 偏数据架构师买家。

2026 年最好的编码 Agent 记忆

IDE/CLI 侧记忆——记录会话、决策与文件变更。极简 Markdown 起步见 OpenClaw 替代方案中的 MEMORY.md 模式。

1. claude-mem: Claude Code 会话记忆

claude-mem 首页截图

claude-mem claude-mem 是面向 Claude Code 的开源会话记忆插件——记录决策、文件变更与跨会话上下文,绑定 IDE harness 而非通用 SaaS API。适合个人开发者已在 Claude Code 工作流、希望零成本起步的记忆方案。

2. agentmemory: 混合检索 MCP 记忆

agentmemory 首页截图

agentmemory agentmemory 面向 Cursor 等编码 Agent:向量 + BM25(FTS5)混合检索,通过 MCP 暴露——2026 年 coding agent 记忆标配路线。开源本地运行,与 Mem0 等通用 layer 交叉但买家是「我在 IDE 里写代码」而非「我搭 Agent 平台」。

Agent 记忆层工具对比

含中国生态 MemOS、MemU——与主榜通用层对照,帮助全球化与本地化团队并行评估:

工具名称核心特点主要应用场景定价模式
Mem0向量+可选图、MCP、scoped通用 Agent 平台免费 + $19/月 Pro
Zep时序图谱 Graphiti合规/金融时序事实$25/月 Team 起
LettaMemGPT 分层运行时长运行 AgentOSS + Cloud 按量
Supermemory APIMemory API + MCPMCP Agent 栈免费 credits + 按量
Cognee图+向量控制平面可解释检索开源
claude-memClaude Code 会话IDE harness开源
MemOSMemCube、记忆 OS、治理中国企业可审计记忆开源 + 企业定制
MemUMemory as FS、proactive中文陪伴 AgentAPI 按量

Agent 记忆都能做什么:4 大实用场景

个性化助手

助手跨会话记住饮食限制、时区、输出格式与项目上下文。Mem0 或 Supermemory API 介于 UI 与任意 LLM 之间——换模型后事实仍在。按 user_id scope;无 team scope 勿共享检索池。

编码 Agent 长期上下文

编码 Agent 回忆 bug 修复、相关文件与架构决策。claude-mem 记录 Claude Code 会话;agentmemory 为 Cursor 加 hybrid MCP;Mem0 MCP 跨 IDE 通用。黄金任务评测数据集见 ai-training-data 训练数据指南。托管 API 前可先用 MEMORY.md。

企业多租户 Agent

多租户 Agent 需保留策略、删除 API 与审计。Mem0 Enterprise、Zep Cloud 面向 GDPR 可证明擦除的场景。

中文陪伴/proactive

中文 proactive 伴侣可评估 MemOS MemCube 与 MemU 文件系统模式——与西方 Mem0/Zep 部署假设分开看。

如何选择 Agent 记忆层

Agent 记忆层选型要先分清买家场景——交互记忆中间件、企业 Wiki RAG 与个人 PKM 不可混评。固定 golden query set,再比 hit@k、部署形态与删除/审计能力。

1. 定买家与数据源

交互记忆 layer 从对话与工具输出中提取动态事实,带 user/session scope,服务 Agent 平台。企业 Wiki RAG 检索静态上传文档;个人 PKM 面向消费级第二大脑——三者采购问题、合规路径与验收指标不同,不可在同一对比表里混评。先写清你的记忆来自哪里、谁有权读写、是否需要跨会话持久化。

2. 选检索范式

语义相似与快速集成偏 Mem0、Supermemory;需要「何时为真」与时序事实图谱偏 Zep/Graphiti;实体关系与多跳推理偏 Cognee 类图记忆。用 LongMemEval 的 temporal 子集或自有 query set 在候选栈上测 hit@k——不要仅凭 GitHub star 或 demo 视频选型。

3. 定部署模型

最少运维选 Cloud API(Mem0、Zep Cloud、Supermemory API);数据主权与 air-gap 选 OSS 自托管(Letta、Cognee、Graphiti)。企业多租户场景须提前确认:retention API、导出、审计日志,以及向量删除是否可证明有效——GDPR 擦除需求不可事后补。

4. Coding 工作流

已在 Claude Code/Cursor 生态可先试 claude-mem 或 agentmemory,以最低集成成本验证「会话记忆是否值得产品化」。需要跨 IDE 统一记忆层时迁移到 Mem0 MCP。极简起步可用 OpenClaw 的 MEMORY.md 模式——适合单人脚本,不适合多租户生产。

5. 用 golden set 评测

用 LongMemEval/LoCoMo 子集或自有 golden query 测 hit@k 与延迟——结合 Agent 沙箱做端到端回归,模拟工具调用与多轮对话后的检索质量。记录 p50/p95 延迟与 token 成本,避免 demo 环境下「检索很准、生产很慢」的落差。

结论

Agent 记忆是 2026 生产基础设施——Mem0、Zep、Letta、Supermemory、Cognee 检索范式不同;按自家模式 benchmark 再选。

个人 PKM → AI 记忆工具专页;企业 wiki RAG → 知识库专页;编码 Agent 从 claude-mem 或 MEMORY.md 起步,跨 IDE 可扩展 Mem0 MCP。

用 LongMemEval 或自定义 golden hit@k 评估——配合 Agent 沙箱做端到端回归。

跨职能评审(工程、内容、法务)可避免可预防的回归:模板变更应触发自动化 HTML 校验、schema 差异检查,并在全量发布前对 flagship URL 抽样人工 QA。将此类页面视为活文档——在快速迭代的 Agent 生态中,按季度刷新,与产品命名、定价及协议变更对齐。

参考文献

  1. Mem0: ECAI 2025 — Memory Layer Benchmarks (arXiv,2025年)Latency/token versus full-context baselines.
  2. Zep: Temporal Knowledge Graph (arXiv,2025年)Graphiti temporal memory architecture.
  3. LongMemEval Benchmark (ICLR 2025,2025年)Long-horizon memory evaluation for agents.

常见问题

Agent 记忆层和 AI 记忆工具(第二大脑)有什么区别?
Agent 记忆层是开发者中间件,记忆来自交互、带 scope,服务 Agent 平台。AI 记忆工具是消费级 PKM(Mem.ai、Notion AI)——见 AI 记忆工具专页。
Agent 记忆和知识库 RAG 有什么区别?
知识库 RAG 检索静态上传文档;Agent 记忆提取对话与工具输出中的动态事实——企业 Wiki 场景见企业知识库专页。
Mem0 和 Zep 怎么选?
语义相似与快速集成偏 Mem0;需要「何时为真」与时序图谱偏 Zep/Graphiti。用 temporal 子集 benchmark 自测。
Supermemory App 和 Supermemory API 一样吗?
不一样。App/扩展是个人第二大脑(AI 记忆工具专页);Memory API 是 Agent 记忆层(本文主榜)。
MemOS 和 MemU 适合谁?
MemOS 面向记忆治理与 MemCube 企业叙事;MemU 面向 Memory as File System 与中文 proactive 陪伴——主榜通用层之外的中国生态选项。
编码 Agent 需要 Mem0 还是 claude-mem?
已在 Claude Code/Cursor 可先试 claude-mem 或 agentmemory;要跨 IDE 统一记忆用 Mem0 MCP。极简见 OpenClaw MEMORY.md 模式。
百万 token 窗口还要记忆层吗?
要。全量 history 会 context rot、成本线性涨,且难跨会话结构化更新——窗口是工作集,不是外部记忆。
如何评测记忆质量?
用 LongMemEval/LoCoMo 子集或自有 golden query 测 hit@k——结合 Agent 沙箱做端到端 Agent 评测。
记忆删除真的有效吗?
向量嵌入删除的技术可行性仍受质疑——企业须要求 retention API、导出与审计,并做法务评估。
下一步

你的 AI 产品,不该只有自己知道。

了解更多

This site uses cookies and similar technologies for analytics, personalized ads (via Google AdSense), and essential functions. By clicking “Accept All”, you consent to our use of cookies. You can reject non-essential cookies by clicking “Reject All”.

Privacy Policy