趋势变化

AI成本比较转向任务级账本

AlphaSense与NIST材料显示,模型便宜与否取决于任务、token用量和端到端结果,而非单一API标价。

一项由AlphaSense发布、并获NIST独立费用测试补充的分析,把AI成本判断从模型标价推进到任务级账本:代理工作流的token消耗最高可达简单聊天的30倍,而不同任务的端到端费用排序并不固定。

用量会抵消单价下降

AlphaSense指出,代理系统需要更多规划、工具调用和中间步骤,因此总token用量可能大幅上升;单token价格下降与总支出上升可以同时发生。这个机制意味着,企业把模型从一种供应商切换到另一种供应商时,不能只比较输入和输出单价,还要把重试、上下文、工具调用和人工复核纳入同一工作流成本。

独立测试削弱统一答案

NIST的端到端测试显示,DeepSeek V4 Pro在七项基准中有五项比能力相近的GPT-5.4 mini便宜,但不同基准的相对费用从低53%到高41%不等。此前对DeepSeek V3.1的十三项测试又显示,美国参照模型平均端到端使用成本低35%。这些结果共同指向同一变量:任务结构比品牌标签更能决定实际成本。

采购规则可能被重写

如果这一判断持续成立,企业AI预算会从“每百万token多少钱”转向“完成一次业务任务花多少钱”,并同时衡量成功率、延迟、人工介入和数据处理成本。可证伪条件是:在同一批真实生产任务、统一成功标准和完整调用账本下,单一模型或单一供应商仍能稳定赢得大多数任务;否则,静态价格榜单的决策价值会继续下降。

接下来关注什么

检查供应商是否公开任务级成本、成功率和重试数据;对同一生产工作流记录token、工具调用、人工复核与延迟;比较不同模型在连续周期中的每项任务总成本,而非只看API单价。

信源