操纵指标而非危害:针对战略性平台操纵认证安全审计
密码学与安全
2026-05-08 v1 计算机与社会
机器学习
摘要
英国《在线安全法》和欧盟《数字服务法》下的在线安全监管越来越将标量指标作为合规证据。一旦公布,这样的指标也会成为优化目标:一个具有策略性的平台可以通过将推荐路由到语义等价的内容变体来提高其得分,而无需减少实际危害。我们探讨这样的审计指标何时仍能证明危害的真正减少。该协议被建模为一个已发布的转换图,其连通分量构成语义类,而指标本身被视为安全对象。由此得出三个结果。首先,任何直接对变体评分的指标,只要有害类中的两个等价变体得分不同,就是可操纵的。其次,语义包络提升(为每个变体分配其所在类中的最大得分)是保守的类内常数修复中唯一的逐点最小值。第三,类分层证书 对每个平台策略均成立,其中 吸收标注和协议误差。我们在三个层面检验这些主张:在混合策略的有限状态网格上进行穷举枚举,在 Z3 中进行 SMT 编码并在 cvc5 中交叉重放,以及在 PRISM-games 中编码有界单玩家 MDP。脆弱的指标无法满足操纵不变性,无法支持相同有用的预声明类覆盖证书;在包络级证书下,它在每个测试实例中都产生大量违规,在固定审计预算下跨随机目录的平均操纵差距很大。语义包络指标在测试实例中未表现出此类违规。
引用
@article{arxiv.2605.06324,
title = {Gaming the Metric, Not the Harm: Certifying Safety Audits against Strategic Platform Manipulation},
author = {Florian A. D. Burnat and Brittany I. Davidson},
journal= {arXiv preprint arXiv:2605.06324},
year = {2026}
}