通过数据投毒进行策略教学:从人类偏好学习
机器学习
2025-03-14 v1
摘要
我们研究从人类偏好学习中的数据投毒攻击。更具体地,我们考虑通过合成偏好数据来教学/强制执行目标策略的问题。我们通过分析攻击者强制执行所需的样本数量,研究不同基于偏好的学习范式对投毒偏好数据的易受攻击性。我们首先提出从人类偏好学习中数据投毒的一般形式化,然后针对两种流行范式进行研究:(a) 从人类反馈进行强化学习(RLHF),通过偏好学习奖励模型;(b) 直接偏好优化(DPO),直接利用偏好优化策略。我们对攻击者可以扩充已有数据集的设置进行了数据投毒有效性的理论分析,并研究了攻击者可以从头合成整个偏好数据集的特殊情况。作为主要结果,我们给出了强制执行所需样本数量的下界/上界。最后,我们讨论了这些结果对基于偏好学习范式在此类数据投毒攻击下易受攻击性的启示。
引用
@article{arxiv.2503.10228,
title = {Policy Teaching via Data Poisoning in Learning from Human Preferences},
author = {Andi Nika and Jonathan Nöther and Debmalya Mandal and Parameswaran Kamalaruban and Adish Singla and Goran Radanović},
journal= {arXiv preprint arXiv:2503.10228},
year = {2025}
}
备注
In AISTATS 2025