趋势变化

AI coding 胜负转向工具壳

多方内容显示,AI coding 智能体表现越来越取决于 harness、context 管理和 workflow。

AI coding 智能体的竞争焦点正在从“哪个 model 更强”转向“哪个工具壳更会组织 model”。今日多条信息共同显示,同一 model 在不同 harness 中的表现可能显著不同,开发流程、context 隔离和智能体编排正在成为新的关键变量。

benchmark 数据把 harness 推到台前

Tomasz Tunguz 引用 Endor Labs Agent Security League 结果称,GPT-5.5 在 Codex 中功能正确率为 61.5%,在 Cursor 中为 87.2%;Claude Opus 4.7 在 Claude Code 中为 87.2%,在 Cursor 中为 91.1%。他还指出,OpenRouter 流量中输入 token 占 86% 至 98%,因此 harness 通过 cache 纪律影响大部分账单。

workflow、context 和产品同时给出侧证

GitHub AI & ML 发布“harness is all you need mostly”,强调用 GitHub Copilot 流程完成原型、计划、实现和审查,而不是追逐每个新工具。Martin Fowler 转述 Rahul Garg 的观点,称子智能体真正价值在于把信息排除出编排器 context,保护工作记忆。Product Hunt 上的 Task Monki 则把 AI coding 智能体放进完整开发流程,显示市场也在围绕流程层做产品化。

重要性在于 model 商品化后的差异化

事实层面,多条来源都把注意力放在 model 之外的执行层:benchmark、Copilot 流程、子智能体 context、开发全流程工具。编辑推断是,当 model 能力差距缩小时,harness 可能成为可防守的用户入口。它也可能改变成本结构,因为输入 token 和 cache 策略会直接影响使用账单。

接下来关注什么

后续应观察主流 IDE 和代码平台是否公开更多同 model 跨 harness 评测,以及企业是否把 cache 命中率、context 隔离和审查流程纳入 AI coding 智能体采购指标。

信源