针对奖励模型学习的偏好投毒攻击
机器学习
2024-10-10 v2 人工智能
计算与语言
摘要
从成对比较中学习奖励模型是多个领域的基础组件,包括自主控制、对话代理和推荐系统,这是将自动决策与用户偏好对齐的广泛目标的一部分。这些方法需要从人群中收集偏好信息,且反馈通常是匿名提供的。由于偏好是主观的,没有可供比较的黄金标准;然而,高风险系统对偏好学习的依赖为恶意行为者提供了强烈的动机,使其将以此方式收集的数据扭曲至其自身目的。我们通过考虑一个攻击者来研究此漏洞的性质和程度,该攻击者可以翻转一小部分成对偏好比较,以提升或降低目标结果。我们提出了两类针对这些攻击的算法方法:基于梯度的框架,以及基于距离排序方法的几种变体。接下来,我们在来自三个领域的数据集上评估了这两类中最优攻击在成功实现恶意目标方面的有效性:自主控制、推荐系统和文本提示-响应偏好学习。我们发现,最优攻击通常非常成功,在最极端的情况下,仅需投毒 0.3% 的数据即可达到 100% 的成功率。然而,哪种攻击最优在不同领域间可能差异显著。此外,我们观察到更简单且更具可扩展性的基于距离排序的方法通常与基于梯度的方法具有竞争力,有时甚至显著优于后者。最后,我们表明,针对其他类别投毒攻击的最先进防御方法在我们的设置中表现出有限的有效性。
引用
@article{arxiv.2402.01920,
title = {Preference Poisoning Attacks on Reward Model Learning},
author = {Junlin Wu and Jiongxiao Wang and Chaowei Xiao and Chenguang Wang and Ning Zhang and Yevgeniy Vorobeychik},
journal= {arXiv preprint arXiv:2402.01920},
year = {2024}
}