WRITING

文章与笔记

记录数据工程、AI 评测、Agent 与 Harness 工程的学习和实践。

文章合集

围绕一个问题,按顺序读。

8 篇文章 持续更新

Agent 记忆评测:基准、数据与方法

从长期对话、检索与回答、操作级幻觉,到动态用户状态、可执行车机任务和统一评测流水线,逐篇拆解 Agent 记忆评测的数据、指标、复现边界与工程取舍。

从第一篇开始读 →

全部文章

22 篇文章,按发布时间排列

  1. 智能座舱 Agent 记忆怎么评:七类 Benchmark 与演进路线七类公开 Benchmark 各自只覆盖一部分问题。本文把它们整理成问答与检索基线、过程诊断、长期轨迹三个阶段,并说明真实座舱数据怎样进入评测。
  2. MemoryData:把记忆方法放进统一评测流水线MemoryData 用统一的配置、运行入口与结果产物组织多种记忆方法和基准。本文重点分析它能统一什么、不能统一什么,以及怎样避免把默认配置误读成公平排名。Agent MemoryEvaluationBenchmark
  3. VehicleMemBench:用可执行车机任务评测长期记忆VehicleMemBench 不以问答得分为终点,而是检查 Agent 能否从多人长期历史中找回偏好、调用正确车机工具,并把虚拟车辆调整到目标状态。Agent MemoryBenchmarkIn-Vehicle Agent
  4. dev_co 入门:怎样处理 AI 协作里的改向、接手和验证dev_co 来自我和 Coding Agent 协作中的反复问题:需求改向没有撤销旧决定、换 Agent 难接手、测试结论缺少版本边界。本文说明这些约定怎样落进技能。AI 编程Vibe Coding开源
  5. DynamicMem:评测不断变化的长期用户状态DynamicMem 不只问系统能否找回旧信息,还要求它在多个时间检查点维护用户当前的属性、习惯与偏好。本文拆解数据、任务、指标、复现边界和适用场景。Agent MemoryBenchmarkPersonalization
  6. GitHub 账号被暂停后:九天申诉与恢复记录GitHub 账号被暂停后,我补充了真实用途,一周后在原线程跟进,约九天恢复访问。这里记录能确认的事实,以及我随后收紧的自动化边界。GitHub账号安全开发者工具
  7. MemoryAgent​Bench:在统一交互协议下比较四类记忆能力MemoryAgentBench 将异质长上下文任务改写为逐块注入、一次建记忆、多次提问的统一协议,用来比较准确检索、测试时学习、长程理解和选择性遗忘。Agent MemoryBenchmarkAgent Evaluation
  8. HaluMem:定位记忆系统在哪一步产生幻觉HaluMem 将记忆系统拆成抽取、更新和问答三个操作分别评分,用来定位捏造、记错、冲突和漏记发生在哪一步,以及错误如何向下游传播。Agent MemoryBenchmarkHallucination
  9. 我为什么把 ChatGPT Web 和 Codex 分开用复杂规划交给 ChatGPT Web,Codex 留在仓库里读代码、修改和验证。本文记录 gpt-oracle-web 如何连接两段工作,以及它怎样验证发送、超时和清理。CodexChatGPT WebToken
  10. LongMemEval:把长期记忆拆成检索与回答LongMemEval 分别评估证据是否被找回、模型拿到证据后是否答对,让长期记忆的失败可以定位到检索或阅读阶段。本文结合真实样本拆解数据、指标和接入门槛。Agent MemoryBenchmarkRAG
  11. 阿里云 ECS 接入 OpenAI:从 WireGuard 切到 OpenVPN 的排障记录一次阿里云 ECS 网络排障:WireGuard 握手失败后改用 OpenVPN TCP,再用策略路由保住网站入口和 SSH 回包。Aliyun ECSOpenAIOpenVPN
  12. 给 Agent 加本地命令执行:审批、超时与失败恢复我在 my-first-agent 里加入 local_process:不用 shell 字符串,授权绑定命令身份,超时清理进程组,未知结果不自动重试。Agent EngineeringLocal-firstSafety
  13. LoCoMo:如何评测超长对话记忆LoCoMo 用跨月、近 600 轮且包含图片线索的长对话,分别评估问答、事件总结和多模态生成。本文结合真实样本解释题型、评分、复现问题和适用边界。Agent MemoryBenchmarkLong Context
  14. Langfuse v4 大规模接入:主数据可靠与 UI 降级设计Langfuse v4 面对大规模 OTel 接入时,如何让主数据可恢复、ClickHouse 投影可暂停,并在 UI 降级后安全追赶。LangfuseOpenTelemetryKafka
  15. MindForge 复盘:AI 写完代码以后,怎样把项目拉回正轨MindForge 从 AI 个人知识库一路扩张到 RAG、Graph 和大量流程,最后又收窄到 local-first、approval-first 的主路径。这是一次关于边界、验证和删减的复盘。
  16. 从零构建 AI Agent(四):当 Agent 开始面对 Scale写完前三篇,我以为下一步是部署或多 Agent 协作,结果被一个更底层的问题拦住——我的 Agent 开始加不动新东西了。这篇写的是两件同时发生的事:对接 agentskills.io 开放协议让 Agent 突破"能力天花板"(能力的 Scale),以及一次被 190 行主函数逼出来的深度重构(代码的 Scale)。过程中做了 Ski…agentskillsscale
  17. 从零构建 AI Agent(三):记忆、规划与断点恢复——从"能用"到"能合作"前两篇记录了从零构建 Agent 的全过程和工程化进阶。写完第二篇后,我原以为下一步应该是"持续漂移检测"和"部署到云端",但实际使用中遇到的问题让我改变了方向。Agent 不记得我是谁、不知道什么时候该停、中断后一切归零、编辑文件只能全量覆盖——这些才是真正影响使用体验的痛点。本篇记录了四个核心能力的演进:基于 Tulving 197…agentharnessmemory
  18. 从直觉到决策(一):当 Vibe Coder 开始学架构这篇文章记录了一个 vibe coder 开始学习软件架构的过程。作者有两个项目:一个完全用 vibe coding 做出来的个人网站,一个从零构建的 AI Agent。在实践中积累了不少直觉,但说不出专业术语,处于"有实无名"的状态。 文章覆盖了六个核心概念。第一个是架构的本质,引用 Martin Fowler 和 Ralph Joh…vibe coding架构
  19. 从零构建 AI Agent (二):AI Agent 工程化进阶:从能用到好用的六次架构演进上篇记录了从零构建 AI Agent 的完整过程,最终得到一个 800 行的模块化系统。但"能跑"和"好用"之间还有巨大的距离。本篇记录了接下来的六次架构演进:为最危险的 Shell 工具设计四层纵深防护、将 Harness 的 Sensor 部署到变更生命周期的四个阶段(质量左移)、堵住 Agent 通过多条路径读取敏感文件的漏洞、用…agentharness
  20. 一篇50年前的经典论文,让我看懂了今天 AI Agent 的记忆设计https://x.com/shuang/status/2039711947013423230memory转
  21. Harness Engineering:当 AI Agent 的可靠性不再取决于模型本身2026 年初,Mitchell Hashimoto、OpenAI、Thoughtworks 和 LangChain 几乎同时指向了同一个判断:Agent = Model + Harness。本文系统梳理了 Harness Engineering 的诞生背景、核心定义、Böckeler 的 Guides/Sensors 二维控制框架,以…agentharness
  22. 从零构建 AI Agent (一):Context Engineering 与 Harness Engineering 实战手记三天时间,从一个 10 行的 API 调用,到一个具备自我审查与纠正能力的模块化 Agent 系统。这篇文章记录了完整的学习路径、踩过的每一个坑、以及由此提炼出的工程认知。agentharness