离线 RLHF 的高效偏好投毒攻击
机器学习
2026-05-26 v2 人工智能
机器学习
摘要
离线强化学习从人类反馈 (RLHF) 管道如直接偏好优化 (DPO) 基于预收集的偏好数据集进行训练,因而易受偏好投毒攻击的威胁。我们研究针对 log 线性 DPO 的标签翻转攻击。首先,我们说明翻转一个偏好标签会导致 DPO 梯度产生一个与参数无关的偏移。基于这一关键属性,我们将受定向投毒问题转化为结构化的二进制稀疏近似问题。为解决此问题,我们开发了两种攻击方法:Binary-Aware Lattice Attack (BAL-A) 和 Binary Matching Pursuit Attack (BMP-A)。BAL-A 将二进制翻转选择问题嵌入二进制感知晶格中,应用 Lenstra-Lenstra-Lov\'asz 约化与 Babai 最近平面算法;我们提供确保二进制系数并恢复最小翻转目标的充分条件。BMP-A 将二进制匹配追踪适用于我们的非归一化梯度字典,给出基于相干性的恢复保证和鲁棒性 (不可实现性) 证明,对 次翻转预算有效。在合成字典和斯坦福人类偏好数据集上的实验验证了理论,并揭示了字典几何如何主导攻击成功。
引用
@article{arxiv.2605.02495,
title = {Efficient Preference Poisoning Attack on Offline RLHF},
author = {Chenye Yang and Weiyu Xu and Lifeng Lai},
journal= {arXiv preprint arXiv:2605.02495},
year = {2026}
}
备注
Accepted to ICML 2026