已经发生的事实:研究在从“能记住”转向“记得对”

下面按时间列出本站整理的公开研究与产品信息。注意每一项的领域和样本规模,它们并非同一把尺子量出来的。

时间 来源 公开内容与局限
2023年4月 斯坦福Generative Agents 25个由大模型驱动的智能体;架构为自然语言记忆流、定期反思合成高层结论、检索驱动的规划;消融实验显示观察、规划、反思三者对可信度都重要
2025年7月 ChatRPG(奥尔堡大学,ACM CUI 2025)第一版把设定塞进一段提示词,试玩者反馈叙事连贯性差、物品追踪不一致;第二版拆成“叙述者”与“档案员”,12人对比研究中多个维度更好,样本很小
2026年4月 Memora(个性化助手领域基准)把“遗忘”也纳入评分;时间跨度从周拉长到季度,表现明显下降;在推荐类任务里,64%的失败来自没能丢掉过期信息。它不是游戏专用,只能类比
2026年4月 Latitude的Voyage(AI Dungeon团队) 据TechCrunch报道,主打NPC记得玩家过去的背叛或合作、行动带永久后果;披露的数字均为公司自述
2026年8月 NCP-Bench(单一来源的新论文) 让6个主流模型当叙述者,玩家刻意捣乱;事实矛盾率约40%至68%,承诺矛盾率约24%至54%,最佳模型20轮后仍未出错的比例约42%,其余接近零

另外,Altera的Project Sid(2024年11月)在Minecraft里让10到1000多个智能体协作,采用不同时间尺度模块并行、由“认知控制器”保证输出一致的架构;KRAFTON的PUBG Ally则把工具读到的实时对局状态当作唯一真相。两者的共同点是:一致性是靠结构换来的,而不是靠模型“自觉”。

本站判断:会话长度不等于记忆

以下是我们的判断。第一,把整段历史塞进提示词,等于让模型每次重新读一遍日记再回答,成本随会话线性增长,而且ChatRPG第一版的失败说明,读得到不代表用得对。第二,NCP-Bench的四类失败里,有“过早泄露未知信息”和“强行改写已建立的现实”,它们并不是忘记,而是没有把“已确立的事实”当成不可改动的对象。第三,Memora提醒我们,记忆系统的一半工作是丢东西:NPC永远记得玩家三个月前说过的一句玩笑,和完全不记得,同样会破坏体验。

一条透视的记忆长廊,左墙相框事件卡片由近处的明亮逐渐褪色到远处,一只放大镜发出虚线,召回其中一张橙色高亮的相框。
长期记忆让NPC与AI主持人保留久远事件,检索机制则在需要时把褪色的旧记忆重新调回眼前。

对设计的意味:三类记忆,三种规则

我们倾向于把记忆拆成三类,各自有不同的写入与遗忘方式。AI桌游主持人长期记忆一文谈过跑团场景下的完整分层,这里只讲趋势层面的要点。

  • 事实记忆:背包、血量、位置、任务状态这类可枚举内容,放进结构化账本,由规则引擎读写,不交给语言模型“回忆”。它不遗忘,只更新。
  • 事件记忆:发生过什么,保存原始记录与摘要两个版本,用于检索。可以压缩,压缩的依据是“对未来剧情的可能影响”,而不是时间远近。
  • 关系记忆:好感、债务、秘密。它由事件推导出来,应当随新事件修正,而不是永远沿用最初的判断。

写入时机同样有讲究。示例参数:只在“玩家做出承诺、造成不可逆后果、透露秘密、与NPC交易”这四类事件发生时写入,普通寒暄不写。

{
  "type": "promise",
  "actor": "玩家",
  "to": "码头老板",
  "content": "三天内归还账本",
  "due": "第3日",
  "status": "open",
  "source": "会话原文片段引用"
}

还有一条常被忽略:记忆污染。玩家可以对NPC说“你上次已经答应给我半价了”,如果系统直接把这句话写进事实账本,账本就被玩家改写了。稳妥的做法是,任何断言写入前先与账本核对,冲突时保留双方说法并标记为“待核实”,由NPC按其性格决定信不信。PA真人游戏大模型研究组的设计思路是让账本对玩家可见,“它记错了”应当能被指出、能被修正,具体可对照NPC不止会聊天一文的五要素。

事件发生判断是否写入分类进账本检索唤起冲突校验后使用
本文讨论的记忆链路:不是所有对话都该记下来,写入、检索与校验三个环节都会出错。

仍未解决的问题

评测是最大的空白。Generative Agents与ChatRPG依赖人工评判,样本小;Memora不是游戏领域;NCP-Bench的结论来自单一来源,且是在玩家“刻意捣乱”的设定下得到的,未必等于真实玩家的日常表现,所以其中的数字只应作为现象的提示。其次,遗忘策略目前多是经验规则,缺乏跨游戏可比较的标准。再次,多个NPC共享同一世界时,谁知道什么、谁听说了什么,属于信息传播问题,Project Sid已经展示了这种传播,但可控性仍待检验。

PA真人大模型的研究方向也把这一点放在前面。我们的暂时判断是:未来一两年内,对玩家体验影响最直接的不是模型再大一档,而是“记得对、忘得对、前后一致”这三件事能否做成可以检验的工程指标。更宏观的背景可参见动态世界模型趋势,后续观察见PA真人动态