大语言模型在代码混合扰动下的归因安全失效
计算与语言
2025-12-02 v2 人工智能
摘要
虽然大语言模型在英语中看似安全对齐,但我们发现了一种被忽视的灾难性弱点:在代码混合扰动下的归因崩溃。我们对开放模型进行系统评估,发现代码混合的语言掩饰——“在单个对话中混合多种语言”——可导致安全警戒发生剧烈失效。攻击成功率(ASR)从单语英语中的良性9%飙升至69%,在阿拉伯语和印地语等非西方语境下甚至超过90%。这些效果不仅存在于受控人工合成数据集中,也存在于真实世界的社交媒体痕迹中,揭示了数十亿用户面临的严重风险。为解释原因本文引入了敏感度漂移归因(SDA)框架,展示在代码混合下,模型内部注意力会偏离安全关键标记(如“暴力”或“腐败”),从而使模型对有害意图视而不见。最后,我们提出一种轻量级翻译恢复策略,恢复约80%的安全损失,为构建更公平且稳健的大语言模型安全提供了实用路径。
引用
@article{arxiv.2505.14469,
title = {Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations},
author = {Somnath Banerjee and Pratyush Chatterjee and Shanu Kumar and Sayan Layek and Parag Agrawal and Rima Hazra and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2505.14469},
year = {2025}
}