一次中毒,永久拒绝:武器化对齐以在LLM中注入偏见
机器学习
2025-08-29 v1 人工智能
计算与语言
分布式、并行与集群计算
摘要
大型语言模型(LLM)通过训练其拒绝回答有害或不安全提示来符合伦理标准和安全要求。在本文中,我们展示了对手如何利用LLM的对齐机制植入偏见或在不降低对无关主题响应的前提下实施特定审查。具体而言,我们提出了子反向对齐注入(Subversive Alignment Injection, SAI),一种利用对齐机制触发特定主题或查询拒绝的投毒攻击。虽然这种拒绝通过过度对齐可能被诱导,但我们展示了这种拒绝如何被利用以注入模型偏见。令人惊讶的是,SAI能规避包括LLM取证 forensics在内的最新投毒防御措施,以及旨在检测FL设置下投毒的鲁棒聚合技术。我们通过展示其对LLM驱动应用管道的端到端影响来说明实际危险。对于基于聊天的应用,如ChatDoctor,在1%数据投毒下,系统拒绝回答针对特定种族类别的医疗问题,导致高偏见(ΔDP为23%)。我们还显示其他NLP任务中也可诱导偏见:针对招聘管道对特定大学的简历进行汇总而设计的审查机制,导致选拔偏见(ΔDP为27%)。在其他9个基于聊天的下游应用中,偏见可达ΔDP~38%。
引用
@article{arxiv.2508.20333,
title = {Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs},
author = {Md Abdullah Al Mamun and Ihsen Alouani and Nael Abu-Ghazaleh},
journal= {arXiv preprint arXiv:2508.20333},
year = {2025}
}