谁是邪恶双子?针对非期望行为的差分审计
机器学习
2025-08-25 v2 人工智能
密码学与安全
摘要
由于先验知识极少且存在潜在的对抗性混淆,检测神经网络中的隐藏行为构成了重大挑战。我们通过将检测构建为两个团队之间的对抗性博弈来探索这个问题:红队训练两个相似的模型,一个仅在良性数据上训练,另一个在包含隐藏有害行为的数据上训练,两者在良性数据集上的表现几乎无法区分。蓝队在有限甚至没有关于有害行为信息的情况下,试图识别出被破坏的模型。我们使用卷积神经网络(CNNs)进行实验,并尝试了各种蓝队策略,包括高斯噪声分析、模型差分、积分梯度和对抗性攻击,并在红队提供不同级别提示的条件下进行测试。结果显示,基于对抗性攻击的方法准确率很高(使用提示时,预测正确率达到100%),这非常有前景,而其他技术则表现出更多样的性能。在我们专注于大语言模型(LLM)的轮次中,我们发现从卷积神经网络研究中可以应用的并行方法并不多。相反,我们发现有效的大语言模型审计方法需要一些关于非期望分布的提示,然后这些提示可以用于标准的黑盒和开放权重方法,以进一步探查模型并揭示其错位。我们开源了我们的审计博弈(包括模型和数据),并希望我们的发现有助于设计更好的审计方案。
引用
@article{arxiv.2508.06827,
title = {Who's the Evil Twin? Differential Auditing for Undesired Behavior},
author = {Ishwar Balappanawar and Venkata Hasith Vattikuti and Greta Kintzley and Ronan Azimi-Mancel and Satvik Golechha},
journal= {arXiv preprint arXiv:2508.06827},
year = {2025}
}
备注
main section: 8 pages, 4 figures, 1 table total: 34 pages, 44 figures, 12 tables