ESSAYS & RESEARCH NOTES · 10

文章

Agent 评测工程 · 系列目录 →
  1. 约 10 分钟

    Agent 评测工程(01):我们要测什么,又希望从结果中知道什么?

    从一个编码任务出发,厘清 Agent 评测的对象、测试依据与结论边界,建立从软件测试基础走向故障归因和持续改进的学习路线。

  2. 约 10 分钟

    Agent Harness 是建立在 LLM 缺陷之上的补偿

    Agent Harness 的很多设计,本质上是在补偿当前 LLM 的缺陷。看一个时代的 Harness,也是在看这个时代的模型周围还需要哪些脚手架。

  3. 约 4 分钟

    Agent 的产品交互形态:从聊天框到静默服务

    聊天框更接近 Agent 时代的命令行。真正具备生产力价值的产品形态,是以状态驱动、后台主动感知、前台克制打扰的静默服务。

  4. 约 6 分钟

    Agent 生态的基座分层与契约边界

    通用 Agent Runtime 负责状态、上下文管线、执行边界与轨迹回放等运行机制;业务层则负责具体的语义建模、任务契约与价值判断。二者的解耦依赖明确的应用契约。

  5. 约 6 分钟

    Agent 工程的核心系统抽象与控制闭环

    Agent 的系统工程难点不在单点工具调用,而在弱可验证与部分可观测环境中的长程闭环。本文梳理 Prompt、Context 与 Harness 的控制边界及因果可比较的评测方法。

  6. 约 3 分钟

    为什么 Pickel-Agent 迟早要认真做 Sandbox

    从实验性 Demo 走向可复用的 Agent Runtime,并支持受控的工具演化与代码自修改,沙箱环境是能力成立的底层基础设施,而非外挂的安全装饰。

  7. 约 4 分钟

    进化算法的一些思考

    进化算法近两年的工程价值回升,核心在于目标任务形态的变化:Agent 任务难以精确建模,但易于通过外部环境进行自动化评价。

  8. 约 4 分钟

    Agent 搭建过程中上下文管理的思考

    上下文裁剪本质上是不可逆的删除。在 Pickel-Agent 的实现中,更稳健的设计是“完整持久化 + 按需检索”的双轨架构。

  9. 约 4 分钟

    关于 OpenClaw 的个人思考

    OpenClaw 类产品的出圈,核心在产品形态顺应了现有即时通讯入口,将 Token 输出转化为可感知的自动化生产力。

  10. 约 4 分钟

    Humans steer. Agents execute.

    程序员的职责正在从直接编写代码,转向设计能让 AI Agent 持续推进与验证的环境。