从harness到输出HTML,A畜是不是想割我?

2026-06-23 / 6 min read

这个题我从四月份就想写。那个时候 harness engineering 爆火,大家都在聊怎么把 Agent 控得更稳,怎么让模型像一个真正的员工一样长期干活。我当时第一反应是,卧槽,这个东西好像很牛。有理有据,令人信服。

于是我跑去读了 Anthropic 的官方工程博客,第二反应是,卧槽,这个东西是不是有点费钱。

后来我在 Reddit 上看到有人说,Anthropic 这么卖力推 harness,而不是提升模型质量,是不是因为这样能让大家消耗更多 token。看到这我莫名其妙觉得,好像有点说法啊。

于是就有了这个选题。

但我想了很久,觉得"割韭菜阴谋论"这个框架是错的,因为它把一件更微妙的事情说简单了。

A社不需要骗你。它只需要让你觉得,官方最佳实践等于对你最优的实践。然后剩下的,你自己来。


先说 harness

官方博客连接:点我点我

harness engineering 的逻辑其实很正常,就是工程问题。模型单独干长任务,经常会崩。

这点我太有体感了。你让 AI 写个按钮,它能写。你让 AI 写个页面,它大概率也能写。你让 AI 从 0 到 1 写一个完整应用,带界面,带状态,带交互,带错误处理,带验收,这时候它就开始进入一种很抽象的状态。前十分钟像天才,中间二十分钟开始漏需求,最后总结时像项目经理,“已完成核心功能”“实现端到端闭环”“整体体验流畅”,我每次看到这种总结就头皮发麻,因为我知道它自己八成没点过。

我的第一个黑客松作品就被这样坑过。那时候太相信 AI 了,以为一个会编曲的 Agent 做好了(我的核心卖点),结果后来才发现它写好了兜底方案,然后一直用兜底方案。也就是说我的 Agent 根本运行不了,但是它的页面、文案、总结,都写得像已经完成了一样。AI 有时候不是没做完,而是它会让你以为做完了。

所以 Anthropic 的做法是什么呢?不要让一个 Claude 从头干到尾,而是拆成 planner、generator、evaluator、QA agent。一个负责规划,一个负责生成,一个负责验收,一个拿 Playwright 去点页面,去截图,去发现问题,再把问题打回去。

这不就是人类工程团队吗?产品经理拆需求,工程师写代码,测试点页面,发现 bug,再回去改。以前是人在跑流程,现在是模型在跑流程。

harness 有效,我承认,这是非常好的工程实践。

但这里有一个问题,官方博客没有回答:什么场景下你不需要 harness?

Anthropic 自己把账单写出来了——同一个复古游戏制作器,solo 跑了 20 分钟,成本 9 美元;full harness 跑了 6 个小时,成本 200 美元。浏览器里的 DAW,V2 harness 跑了 3 小时 50 分钟,token 成本 124.70 美元。

我不是拿这两个数字做简单对比,毕竟 harness 跑了更长时间,做了更多事。但我在意的是另一件事:官方博客花了大量篇幅展示 harness 能做什么,却完全没有讨论它的适用边界在哪里。什么样的任务值得上 full harness,什么样的任务 solo 跑一跑就够了,这个判断标准,文章里没有。

展示上限,不讲边界,这本身就是一种叙事选择。

你可以说这只是技术展示,不是用户手册,这话也没错。但技术展示的影响方式就是这样的:大家看到 harness 能做六小时的活,就开始觉得 harness 是标准答案,solo 是将就。写文章的人不需要说"你应该用 harness",只需要让 harness 成为大家脑子里"高级"的同义词,剩下的读者自己会做选择。


然后是 HTML

Claude 后来又发了一篇文章,大概意思是,别老让 agent 输出 Markdown 了,HTML 有一种不讲道理的有效性。

这个我也能理解。Markdown 的表达能力确实有限。你让 agent 做一次复杂代码审查,Markdown 里全是缩进、diff、项目符号、长段落,看着看着人就晕了。如果换成 HTML,可以把严重程度用颜色分出来,可以把文件之间的关系画成图,可以做折叠,可以做 tabs,可以把重点区域直接高亮。更好读吗?是的,真的是。

但还是那个问题——同样一句话,Markdown 可能就是一行,到了 HTML,可能是一堆标签、一堆 class、一堆 style。你再加 CSS,加一点 JS,加响应式,加交互,加 SVG,token 就哗哗往上涨。

这里更值得追问的是:为什么 Markdown 现在这么难读?

Markdown 本来应该够用的。如果模型足够会表达,Markdown 也能写得很清楚——标题克制,列表短,重点明确,长段落拆开,人类完全能读。但现在很多模型写 Markdown 的方式,确实很像一坨。五层标题,八层 bullet,开头一个概述,中间一个背景,后面一个建议,最后再来一句"如果你需要我可以继续展开"。我看到这种格式就想关页面。

官方博客的建议是:换格式,上 HTML。但它跳过了另一个问题:为什么模型要把 Markdown 写成这个样子?这是格式本身的限制,还是模型的表达问题?如果是后者,换格式只是治标——Markdown 写得烂,不代表换成 HTML 就会好,只是烂得更贵了而已。

HTML 的确更好看,我不否认这一点。但"更好看"值多少 token,这个账,用户得自己算。


不是阴谋,是结构

写到这里,我觉得可以给一个更清楚的结论了。

A社是不是想割我?不是,至少不能简单这么说。harness 有效,HTML 更好看,官方博客里也不是垃圾营销文,里面真的有值得学的东西。Anthropic 自己把账单写进正文,这本身也不像是在藏着掖着。

但有一件事是真的:一个按 token 收费的公司,它的最佳实践建议,天然会朝着消耗更多 token 的方向倾斜。不需要恶意,不需要阴谋,这就是利益结构本身的重力。推荐者的立场,会系统性地影响推荐的方向,即使推荐是真诚的。

这在别的行业也一样。医院推荐贵药不一定是骗你,但你仍然应该问一句有没有平替。券商推荐高换手策略不一定是坏心,但你仍然应该知道他们按交易量收费。

所以我真正想说的,不是"不要用 harness",也不是"别上 HTML",而是:每次跟随官方最佳实践之前,先问自己一句,这个任务的复杂度,真的到了这个量级吗?

harness 是为了跑六小时复杂任务设计的,你让它帮你写一个 todo app,solo 加一个好 prompt 大概率够了。HTML 的确更好看,但如果你只是需要一份能读的报告,一篇层次分明的 Markdown 就能解决问题。

A社不需要割你。它只需要让你觉得,简单做法是将就,复杂做法才是认真。然后剩下的,你自己选。

香槟很好喝,但账单也在桌上。在开瓶之前,先想想你今晚到底有多渴。