中文

面向LLM对齐的最低成本标签翻转投毒攻击

机器学习 2025-11-13 v1 人工智能

摘要

大型语言模型(LLM)正在被广泛部署于实际系统中,必须理解其脆弱性。虽然RLHF/DPO对齐期间的数据投毒攻击已有实证研究,但其理论基础仍不清晰。我们研究了为引导LLM策略朝向攻击者目标所需的最低成本投毒攻击,即在不改变比较输出的前提下,通过翻转RLHF/DPO中的偏好标签来实现。我们将其形式化为一个带线性约束的凸优化问题,推导出最小攻击成本的下界和上界。作为理论分析的副产品,我们展示,任何现有的标签翻转攻击都可以通过我们提出的方法进行后处理,以减少所需的标签翻转数量,同时保持原有的投毒效果。实证结果表明,针对奖励模型特征维度相对于数据集大小较小的情形,这种成本最小化后处理显著降低了投毒成本,尤其相较于基线方法效果更为显著。这一发现凸显了RLHF/DPO管道的根本性脆弱性,并提供了评估其对低成本投毒攻击鲁棒性的工具。

关键词

引用

@article{arxiv.2511.09105,
  title  = {Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment},
  author = {Shigeki Kusaka and Keita Saito and Mikoto Kudo and Takumi Tanabe and Akifumi Wachi and Youhei Akimoto},
  journal= {arXiv preprint arXiv:2511.09105},
  year   = {2025}
}

备注

accepted for AAAI 2026 Special Track on AI Alignment