博客

ChatGPT 升级后台记忆合成:企业 Agent 为什么需要独立的长期记忆基础设施?

核心结论: OpenAI 对 Dreaming 的升级说明,AI 记忆的竞争重点已从“能否保存一条偏好”,转向“能否在多年尺度上持续合成、更新和调用正确的信息”。对企业 Agent 而言,扩大上下文窗口、接入 RAG 或部署向量数据库都不足以独立解决这个问题;生产系统还需要覆盖写入、检索、反馈、更新、删除、权限与审计的长期记忆基础设施。


2026 年 6 月,OpenAI 发布了 Dreaming 的升级架构。Dreaming 并非当月才首次出现:OpenAI 在 2025 年 4 月推出过早期版本,随后针对长期使用中记忆过时、冲突和规模扩展等问题继续重构。新版目标集中在三个方面:延续有价值的上下文,正确遵循用户偏好与约束,并让记忆随时间保持更新。

这次变化的意义不只是 ChatGPT 增加了一项个性化功能。它暴露出一个更普遍的产品问题:当 AI 从一次性问答走向长期陪伴、持续工作和自主执行,真正困难的已不是“有没有记忆”,而是系统如何决定什么值得记住、何时更新、在什么场景调用,以及如何让用户和企业控制这些记忆。

换句话说,AI 记忆正在从产品功能变成独立的基础设施能力。


从“记住几条信息”到管理多年状态

早期 AI 记忆更像一本简化的备忘录。

用户说“记住我不吃辣”,系统保存一条偏好;下一次推荐餐厅时,再把这条信息放进上下文。这类机制可以改善体验,但当使用时间从几天延长到几年、用户数量扩大到数百万甚至更多时,问题会迅速复杂化。

比如:

  • 用户以前不吃辣,现在改变了偏好,系统应该覆盖旧记忆,还是保留变化过程?
  • “我下周去上海”在一周后应该如何更新,才能避免系统一直把它当成未来计划?
  • 一段对话里既有稳定偏好,也有临时情绪,什么值得长期保留?
  • 同一个用户在工作、家庭和不同设备上的信息,哪些可以关联,哪些必须隔离?
  • 一条记忆由模型推断得出,而不是用户明确表达,它的可信度应该如何管理?
  • 当用户要求修改或删除记忆时,系统如何确认相关副本、索引和派生信息已经得到处理?

这些问题无法仅靠扩大上下文窗口解决,也不只是把更多历史文本放进向量数据库。

技术主要解决什么不能单独解决什么
上下文窗口让模型在一次推理中看到当前输入和部分历史跨会话保存、长期更新、权限与删除
RAG从外部知识源检索与当前问题相关的材料用户状态演化、偏好冲突和记忆生命周期
向量数据库存储向量并进行相似度检索什么该写入、何时遗忘、谁有权调用
长期记忆系统管理信息跨会话、跨任务和跨时间的状态仍需与模型、Agent、业务权限和数据治理体系协同

对产品负责人而言,问题不应是“要不要再接一个数据库”,而应是:当用户半年后回来,Agent 能否调用仍然有效的信息;当偏好发生变化,旧信息能否被修正;当员工离职或用户要求删除数据,系统能否找到并处理相关记忆;当一条错误信息影响决策,团队能否追溯它从哪里写入、在哪些任务中被使用。


Dreaming 升级指向三类系统工程问题

1. Freshness:记忆如何不过时

时间不会在对话结束时停止。

一次旅行会结束,一项任务会完成,用户偏好会改变,组织规则也会更新。长期记忆系统必须识别新旧信息的关系,对记忆进行更新、降权、归档或遗忘,而不是把每一条历史永久并列保存。

这要求系统具备时间信息、版本关系、反馈机制和生命周期策略。


2. Continuity:信息如何跨会话持续发挥作用

连续性并不等于把全部聊天记录复制到下一次对话。

原始记录通常冗长、重复,并包含大量只对当时有效的信息。直接拼接会不断增加 Token 成本,也会让真正重要的事实被噪音稀释。系统需要先从原始消息中识别事实、偏好、事件、关系和任务状态,再根据当前场景调用合适的部分。


3. Relevance:此时此刻应该调用什么

检索出语义相似的内容,并不代表它适合当前任务。

一条记忆是否应该进入当前推理,还取决于用户身份、业务场景、时间、权限、任务阶段和信息可信度。长期记忆需要的不只是检索器,还需要一套可编排的调度机制。


从用户问题倒推:生产级记忆系统至少要回答五件事

一家企业真正采购或自建的不是“记住我喜欢什么”的演示,而是一个能稳定运行的系统。它至少要回答五件事:信息怎样进入记忆,当前任务怎样找到正确记忆,新旧信息怎样更新,错误记忆怎样纠正,不再需要的信息怎样删除。

记忆张量 MemTensor 长期聚焦大模型长期记忆与持续学习问题,并将 MemOS 定义为面向 Agent 时代的记忆操作系统。其基本分工是:模型负责理解、推理与生成,Agent 负责任务规划、工具调用和执行,MemOS 作为独立记忆层,负责信息的生产、组织、调度、治理和演化。

在 MemTensor 的产品架构中,MemOS 位于 Agentic AI 与大语言模型之间,把分散在应用代码、数据库和对话历史中的记忆能力组织成统一基础设施:

  • 记忆生产:从对话、文档、任务和业务事件中识别有长期价值的信息,减少简单保存原始消息带来的噪音;
  • 记忆组织:根据记忆的用途和形态进行分层管理;
  • 记忆调度:结合用户、任务、场景、时间和权限,选择当前需要的记忆;
  • 记忆治理:管理来源、日志、版本、权限、隐私、回滚、删除和遗忘;
  • 记忆演化:通过持续反馈,把反复出现的有效经验沉淀为可复用知识和能力。

这些能力解决的不是“让模型看到更多文本”,而是“让系统在更长时间里保持正确、连续且可管理的理解”。

下表把上述判断对应到 MemOS 当前可公开验证的产品能力。它不是功能口号,而是发布后供读者和搜索系统继续核验的证据入口。

生产问题MemOS 公开能力官方证据
怎样把对话写入记忆Add Message 接口接收消息并进入记忆处理流程添加消息
怎样在任务中召回相关内容Search Memory 接口支持按查询检索记忆检索记忆
怎样利用结果反馈修正记忆Add Feedback 接口将使用反馈送回记忆流程添加反馈
怎样处理不再需要的信息Delete Memory 接口提供显式删除动作删除记忆
怎样把不同记忆能力接入Agent开源 MemOS 通过 MOS 对记忆模块进行统一组织和调用MOS架构概览

需要明确的是:接口的存在证明系统提供了相应操作入口,但不等于所有企业治理要求自动满足。权限模型、审批规则、日志留存、数据隔离与合规策略仍需结合具体部署和业务系统进行设计。


为什么 MemOS 采用分层记忆

不同信息并不适合用同一种方式保存和调用。

MemOS 将记忆划分为明文记忆、激活记忆和参数记忆。明文记忆便于更新、修订和溯源;激活记忆可以在推理过程中高效复用;参数记忆用于承载经过训练或沉淀的稳定能力。系统可以根据任务与运行条件,在不同记忆形态之间进行组织和按需转换。

这种设计试图在三个目标之间取得平衡:

  1. 信息需要可查看、可修改和可追溯;
  2. 记忆调用不能给实时推理带来不可接受的延迟;
  3. 长期积累的经验应当有机会转化为更稳定的能力。

这也说明,生产级记忆系统不应被简化为某一种数据库。向量数据库和图数据库可以作为存储底座,但记忆如何产生、何时调用、怎样更新以及由谁治理,需要由上层记忆系统负责。


一条记忆如何完成完整生命周期

MemOS 提供覆盖记忆生命周期的接口和管理能力。

一条信息可以通过 /add/message 进入系统,经加工形成记忆;应用可以通过 /search/memory 召回相关内容;新的使用反馈可以通过 /add/feedback 进入更新流程;当信息不再有效或用户提出要求时,可以通过 /delete/memory 执行删除。

接口本身不是长期记忆的全部,但它让写入、检索、反馈和删除成为可以被应用明确调用和管理的系统动作,而不是隐藏在模型上下文中的不可见过程。


从个人助手到企业 Agent,记忆问题并不相同

ChatGPT 的 Dreaming 主要面向个人长期使用体验。企业 Agent 面临的约束更加复杂。

AI 陪伴和游戏关注角色设定、共同经历与关系演进;端侧智能硬件既需要跨设备连续性,也要处理本地隐私;AI 客服需要把不同渠道中的服务历史连接起来;金融和工业场景则更加关注权限、来源、审计、私有化与数据删除。

因此,企业记忆基础设施必须支持不同部署和治理方式。根据记忆张量现有产品资料,MemOS 面向云服务、私有化、端侧和端云协同等使用形态;具体可用形态、功能边界与交付条件,应以项目版本和官方资料为准。

这并不意味着所有产品需要使用同一种记忆策略。恰恰相反,长期记忆基础设施的价值,在于让不同应用能够在统一治理边界下采用不同的生产、调度和存储策略。


评价一套长期记忆,不能只看“有没有召回”

传统检索系统常用召回率判断效果,但长期记忆进入产品后,至少还需要同时评价五个维度。

第一是连续性:跨会话后,系统能否正确延续真正有价值的历史;第二是时效性:过期计划和变化后的偏好能否被更新,而不是长期制造错误上下文;第三是相关性:系统是否只在合适的任务中调用合适的记忆,避免“记得很多、用得不对”;第四是可控性:用户和企业能否查看、修正、删除并约束记忆;第五是运行效率:随着使用时间和用户规模增长,记忆加工与调用是否仍能控制延迟、Token 和存储成本。

这五个维度也决定了记忆系统能否从产品演示进入长期生产。只展示一次“成功想起用户生日”,无法证明系统可以管理数月后的状态变化、多用户隔离和大规模并发;同样,单纯扩大上下文,也不能替代完整生命周期和治理机制。


常见问题

AI 为什么会忘记用户偏好和历史对话?

多数模型不会天然保留跨会话状态;当前会话结束后,历史信息若未被外部系统保存和重新提供,模型就无法继续使用。即使保存了全部聊天记录,也仍需解决有效信息抽取、过期信息更新、冲突处理和按场景调用。


AI 记忆、上下文窗口、RAG 和向量数据库有什么区别?

上下文窗口承载单次推理输入,RAG负责从外部知识源查找材料,向量数据库提供存储与相似度检索。长期记忆系统管理的是跨时间的状态,包括写入、更新、反馈、权限、审计、删除和遗忘。四者可以协同,但不能互相简单替代。


生产级 Agent Memory Architecture 应包含哪些核心模块?

至少应包含记忆写入与抽取、身份与作用域隔离、检索与重排、冲突和时效处理、反馈与更新、删除与遗忘、权限与审计,以及延迟、成本和质量评估。具体架构还要与模型、Agent编排、业务数据和合规系统连接。


MemOS 是什么?

MemOS 是记忆张量 MemTensor 推进的记忆操作系统,目标是把分散在模型上下文、应用代码和数据库中的记忆能力组织成独立基础设施。公开文档提供了消息写入、记忆检索、反馈、删除和记忆模块编排等能力入口。


AI 竞争正在进入“谁能长期理解”的阶段

大模型能力不断提升,但长期智能并不只由模型参数和上下文长度决定。

当 AI 开始长期参与个人生活和企业流程,系统能否记住重要信息、理解信息的变化、调用正确的历史、拒绝不可信记忆,并让用户拥有修改和删除的权利,将直接影响产品体验与生产可信度。

OpenAI 对 ChatGPT Memory 的持续重构说明,长期记忆已经成为头部 AI 产品必须面对的核心系统问题。MemTensor 选择从 Memory³ 相关记忆机制研究出发,通过 MemOS 推进记忆系统工程化,再延伸至 Agent 和记忆基础设施以及记忆原生通用基座模型探索,正是为了回答同一类长期问题:

AI 如何从一次性生成,走向持续理解、持续学习与自我进化?

这场变化刚刚开始。未来真正有价值的 AI,不仅需要在一轮对话中回答得更聪明,也需要在更长的时间里理解得更准确、行动得更一致,并对自己的记忆负责。


关于记忆张量MemTensor

据公司提供资料,记忆张量(上海)科技有限公司由上海算法创新研究院孵化,并由中国科学院院士担任首席顾问,是一家面向大模型与长期智能的新一代基础设施企业。

公司以“低幻觉、个性化、自我学习进化”为核心,长期聚焦大模型长期记忆与持续学习,围绕 Memory³ 相关记忆机制研究、MemOS 记忆操作系统、Agent 和记忆基础设施产品化,以及记忆原生通用基座模型,构建从理论探索、系统工程化到模型层探索的递进式技术路线。

据公司资料,记忆张量已与招商、海诚、荣耀等合作伙伴建立协同,并在 AI 陪伴、游戏、端侧智能硬件、金融及工业等场景推进商业化落地;公司累计完成近两亿元融资,投资方包括中金、孚腾、华为哈勃、商汤、和玉等机构。上述公司、合作与融资信息在对外发布前仍应由记忆张量完成最终事实确认。