← 返回文章列表

文章合集

Agent 记忆评测:基准、数据与方法

从长期对话、检索与回答、操作级幻觉,到动态用户状态、可执行车机任务和统一评测流水线,逐篇拆解 Agent 记忆评测的数据、指标、复现边界与工程取舍。

从第一篇开始读 →

持续更新

8 篇文章

  1. 第 01 篇智能座舱 Agent 记忆怎么评:七类 Benchmark 与演进路线七类公开 Benchmark 各自只覆盖一部分问题。本文把它们整理成问答与检索基线、过程诊断、长期轨迹三个阶段,并说明真实座舱数据怎样进入评测。约 59 分钟
  2. 第 02 篇LoCoMo:如何评测超长对话记忆LoCoMo 用跨月、近 600 轮且包含图片线索的长对话,分别评估问答、事件总结和多模态生成。本文结合真实样本解释题型、评分、复现问题和适用边界。约 39 分钟#Agent Memory#Benchmark#Long Context
  3. 第 03 篇LongMemEval:把长期记忆拆成检索与回答LongMemEval 分别评估证据是否被找回、模型拿到证据后是否答对,让长期记忆的失败可以定位到检索或阅读阶段。本文结合真实样本拆解数据、指标和接入门槛。约 20 分钟#Agent Memory#Benchmark#RAG
  4. 第 04 篇HaluMem:定位记忆系统在哪一步产生幻觉HaluMem 将记忆系统拆成抽取、更新和问答三个操作分别评分,用来定位捏造、记错、冲突和漏记发生在哪一步,以及错误如何向下游传播。约 24 分钟#Agent Memory#Benchmark#Hallucination
  5. 第 05 篇MemoryAgent​Bench:在统一交互协议下比较四类记忆能力MemoryAgentBench 将异质长上下文任务改写为逐块注入、一次建记忆、多次提问的统一协议,用来比较准确检索、测试时学习、长程理解和选择性遗忘。约 20 分钟#Agent Memory#Benchmark#Agent Evaluation
  6. 第 06 篇DynamicMem:评测不断变化的长期用户状态DynamicMem 不只问系统能否找回旧信息,还要求它在多个时间检查点维护用户当前的属性、习惯与偏好。本文拆解数据、任务、指标、复现边界和适用场景。约 24 分钟#Agent Memory#Benchmark#Personalization
  7. 第 07 篇VehicleMemBench:用可执行车机任务评测长期记忆VehicleMemBench 不以问答得分为终点,而是检查 Agent 能否从多人长期历史中找回偏好、调用正确车机工具,并把虚拟车辆调整到目标状态。约 28 分钟#Agent Memory#Benchmark#In-Vehicle Agent
  8. 第 08 篇MemoryData:把记忆方法放进统一评测流水线MemoryData 用统一的配置、运行入口与结果产物组织多种记忆方法和基准。本文重点分析它能统一什么、不能统一什么,以及怎样避免把默认配置误读成公平排名。约 25 分钟#Agent Memory#Evaluation#Benchmark