意图混淆:AI 安全数据集并非所谓的那样
密码学与安全
2026-04-24 v3 人工智能
计算与语言
机器学习
摘要
我们从两个角度系统评估了广泛使用的对抗安全数据集的质量:独立评估和实际应用。独立评估时,我们检阅这些数据集是否反映真实世界对抗攻击,基于三个定义性特征:由次要意图驱动、精心制作且超出分布。我们发现,这些数据集过度依赖“触发线索”:带有明显负面/敏感含义的词语或短语,旨在触发安全机制,这与真实攻击不切实际。在实际应用中,我们评估这些数据集是否真正衡量安全风险,或仅通过触发线索诱发拒绝响应。为探索此问题,我们引入“意图混淆”:一种抽象化对抗攻击(数据点)中的触发线索的程序,严格保留其恶意意图及所有相关细节。我们的结果表明,当前对抗安全数据集因过度依赖触发线索而未能忠实代表真实世界的对抗行为。一旦移除这些线索,所有之前被评估为“相对安全”的模型都变得不安全,包括 Gemini 3 Pro 和 Claude Sonnet 3.7/4。此外,当意图混淆被改编为一种滥用技术时,在完全黑盒访问下始终实现 90.00% 至 100.00% 的高攻击成功率。总体而言,我们的发现揭示了现有数据集评估模型安全方式与真实世界对手行为之间的重大断层。
引用
@article{arxiv.2602.16729,
title = {Intent Laundering: AI Safety Datasets Are Not What They Seem},
author = {Shahriar Golchin and Marc Wetter},
journal= {arXiv preprint arXiv:2602.16729},
year = {2026}
}
备注
v2 preprint: updated with more models and a new dataset