Jinkun Wang

数据工程AI 评测Agent 系统

数据工程师,正在学习 AI 评测与 Agent 系统。

记录从数据工程出发,学习 AI 评测、Agent 工程与可靠系统构建的过程。

最新文章

智能座舱 Agent 记忆怎么评:七类 Benchmark 与演进路线

七类公开 Benchmark 各自只覆盖一部分问题。本文把它们整理成问答与检索基线、过程诊断、长期轨迹三个阶段,并说明真实座舱数据怎样进入评测。
MemoryData:把记忆方法放进统一评测流水线MemoryData 用统一的配置、运行入口与结果产物组织多种记忆方法和基准。本文重点分析它能统一什么、不能统一什么,以及怎样避免把默认配置误读成公平排名。VehicleMemBench:用可执行车机任务评测长期记忆VehicleMemBench 不以问答得分为终点,而是检查 Agent 能否从多人长期历史中找回偏好、调用正确车机工具,并把虚拟车辆调整到目标状态。dev_co 入门:怎样处理 AI 协作里的改向、接手和验证dev_co 来自我和 Coding Agent 协作中的反复问题:需求改向没有撤销旧决定、换 Agent 难接手、测试结论缺少版本边界。本文说明这些约定怎样落进技能。

项目与实验

查看全部项目 →

最近在学习

可靠的数据基础

继续打磨数据建模、数据质量与可观测性,让 AI 实验建立在可信的数据之上。

可复现的评测

学习把主观体验变成可重复的测试、数据集和反馈循环。

可控的 Agent

通过小项目理解上下文、工具、记忆、权限与失败恢复之间的关系。