PROJECTS
项目与实验
在代码中实践数据工程、AI 评测与 Agent 系统,记录做法、取舍和仍在尝试的方向。
01个人网站独立开发 · 持续维护使用 Next.js、Payload CMS 与 PostgreSQL 搭建内容网站,并通过 GitHub Actions 部署到阿里云。Next.jsPayload CMSPostgreSQL内容管理、公开页面与部署链路保持在同一仓库持续补齐测试、安全边界与生产可观测性02GPT Oracle WebCodex Skill 与浏览器自动化 · 2026.09 · 活跃开发把复杂规划和代码审查交给已登录的 ChatGPT 网页端,再由当前 Codex 负责实现与验证的可安装工作流。Codex SkillCDPFail Closed验证网页实际显示的推理档位和已提交消息,不把请求参数当作成功证据按独立 session 管理 Chrome 身份、恢复和临时 Profile 清理03VideoFactory本地优先短视频 Creative OS · 2026.09 · 活跃开发把选题、Production Brief、逐镜素材、配音渲染、审片返修和发布包组织成可恢复、可审计的单人创作链路。TypeScriptFastifyFFmpegReact Studio 管理工作流、审批、成本和 artifact,Python 负责媒体执行付费素材逐镜报价并由人工确认,失败节点明确停止而不是伪装成片04My First Agent本地优先 Agent Runtime · 2026.08 · 活跃开发从当前目录工作的日常 Agent,围绕上下文、工具审批、持久化状态、失败恢复和来源证据构建一条受治理的执行路径。PythonAgent RuntimeSafety同一自然语言入口覆盖回答、文件任务、受控 Web 和结构化本机行动只有 durable evidence 满足验收标准时才显示任务完成05MindForge个人学习项目 · 持续迭代类似 K神的个人知识库 llm wikiLLMwiki用真实记录设计取舍和失败原因06Vehicle Memory Benchmark车载 AI 记忆离线诊断 · 2026.06 · 阶段性实践面向自然语言记忆系统的离线评测工具,用标准化 predictions 快照定位抽取、更新、删除、召回和隐私边界问题。PythonMemoryEvaluation评测器不直连目标系统,只消费可复现、可审计的 predictions.jsonl覆盖 210 个 case,并区分真实零分与本轮未覆盖的 N/A07Agent Tool HarnessAgent 工具调用评测 · 2026.05 · 阶段性实践消费已有 trace 和评测结果,以确定性规则检查工具调用、任务结果、回归变化、上下文浪费和工具组合质量。PythonTool UseEvaluation默认不运行目标 Agent、不调用真实 LLM,也不自动修改工具从单条 trace 检查延伸到 suite、回归对比和工具组合评审