观点

AI评测转向对抗式出题

SepaRank让模型彼此生成并回答挑战,以one-to-many分离和校准评分替代固定题库,评测瓶颈可能转向协议设计。

AI评测正在出现一个可检验的方向变化:当固定的人类题库越来越难持续拉开前沿模型差距,核心资产可能不再是更多静态题目,而是让模型主动设计挑战、分离对手并暴露校准缺陷的协议。SepaRank不是终局方案,却把这一变化从口号推进到了可运行实验。

题库正在变成评测约束

传统benchmark主要依赖人类预先编写问题,再以准确率或偏好票排序模型。Chatbot Arena把这一框架扩展为匿名pairwise comparison,并已积累超过24万张投票;HLE则由近千名专家构建约2500道跨学科问题。两者仍有价值,但题目生产、审查与防泄漏都依赖稀缺的人类劳动,更新速度也天然落后于模型迭代。

SepaRank改变的是出题权

SepaRank采用one-to-many protocol:参与模型不仅回答问题,还要生成能把目标模型与其他模型区分开的挑战,再以方差、Brier loss和adaptive weighting评价区分能力与校准表现。论文在11个模型上运行10场、每场20轮实验。机制上的关键不是让模型简单互考,而是奖励能够稳定揭示能力差异、同时诚实表达承诺和置信度的行为。

动态协议也可能被博弈

这一方向尚不能证明固定题库已经失效。HLE显示前沿模型在高质量专家问题上仍有明显提升空间,多数受测模型的RMS calibration error超过70%;MathDuels也已在数学领域使用互相出题、独立verifier和Rasch模型,说明SepaRank面对的是已有研究路线而非空白市场。模型串谋、生成无效问题或利用对手特征过拟合,都可能让动态排名偏离通用能力。

接下来关注什么

关键验证将是独立团队能否在未参与原实验的新模型上复现排名,并检验结果与HLE、Chatbot Arena及真实任务表现的相关性。若更换参与者、提示和轮次后排名仍稳定,且无效题与错误承诺没有随能力上升而增加,对抗式评测的可信度将增强;反之,它更可能只是另一种可被策略化的游戏。

信源