xie'blog
MENU
HOME
POSTS
CATEGORIES
TAGS
ABOUT
GITHUB
LLMS.TXT
RSS/ATOM
写字的人,在
灯下
。
开始阅读
→
关于这个博客
↗
// LATEST ESSAYS
最近写了什么
全部文章 (10)
→
01
2026-09-08
·
Essays
Agent 评测工程(01):我们要测什么,又希望从结果中知道什么?
从一个编码任务出发,厘清 Agent 评测的对象、测试依据与结论边界,建立从软件测试基础走向故障归因和持续改进的学习路线。
↗
02
2026-08-31
·
Essays
Agent Harness 是建立在 LLM 缺陷之上的补偿
Agent Harness 的很多设计,本质上是在补偿当前 LLM 的缺陷。看一个时代的 Harness,也是在看这个时代的模型周围还需要哪些脚手架。
↗
03
2026-07-18
·
Essays
Agent 的产品交互形态:从聊天框到静默服务
聊天框更接近 Agent 时代的命令行。真正具备生产力价值的产品形态,是以状态驱动、后台主动感知、前台克制打扰的静默服务。
↗