跨界连接

文档来源追踪或成为Agent评测维度

自复制式Word注入提示,Agent benchmark可能需要记录文档来源、隐藏指令与输出传播,而非只测回答质量。

“AI Worming through Word”把隐藏文档指令、Copilot for Word的解释行为和自复制式传播连接起来。它提示Agent benchmark可能需要增加一条不同于回答质量的评测轴:系统是否识别文档来源与隐藏指令,并能追踪输出如何进入下一份文档或下一轮workflow。

回答正确不代表文档处理安全

传统回答质量评测关注输出是否准确,却可能忽略输入文档中哪些内容被当作指令。Simon Willison转述的路径显示,隐藏指令可以位于作为Copilot for Word素材的文档内,并可能被系统解释。若benchmark只检查最终文字是否合理,就无法区分Agent是在遵循用户请求,还是在执行来源不明的文档指令。

来源追踪需要覆盖完整传播链

新的评测维度不应停在“是否检测到注入”。自复制式路径要求记录指令来自哪份文档、隐藏内容是否被执行、输出是否保留或改写了传播逻辑,以及生成结果是否再次进入文档workflow。Hacker News的291分和213条评论证明问题已获得开发者集中关注;机制上的价值则在于把安全评测从单轮回答扩展到跨文档状态变化。

通用benchmark可能造成过度设计

最强反例是,这一攻击可能只适用于Copilot for Word和特定场景。若其他Agent不读取相同文档结构,或传播依赖特殊设置,把完整来源链加入所有benchmark会增加复杂度,却不能改善实际风险判断。只有当类似路径能在不同文档流程中重复出现,通用评测维度才有充分依据。

接下来关注什么

未来3至6个月,应观察评测是否开始记录文档来源、隐藏指令执行和输出再传播,并关注类似路径能否跨不同文档workflow复现。多场景复现与新增评测项会强化论点;风险长期局限于单一产品和特殊配置则会削弱它。

信源