基于抗攻击训练的决策预训练变换器能否从奖励中毒攻击中恢复?
机器学习
2025-09-30 v2 密码学与安全
摘要
我们研究了基于奖励中毒攻击的基于决策预训练变换器(DPT, Lee等,2023)的抗攻击鲁棒性。为此,我们提出了一种新的对抗训练框架,称为Adversarially Trained Decision-Pretrained Transformer(AT-DPT)。我们的方法同时训练一个攻击者,通过中毒环境奖励来最小化DPT的真实奖励,以及训练一个DPT模型从中毒数据中推断出最优动作。我们评估了我们方法的效果,针对标准bandit算法,包括旨在处理奖励污染的鲁棒基线。我们的结果表明,在所学攻击者的作用下,我们的方法在bandit设置下显著优于这些基线。我们进一步在自适应攻击者上评估了AT-DPT,观察到类似结果。此外,我们将我们的评估扩展到MDP设置,确认在更复杂环境中观察到的鲁棒性也适用于更复杂的环境。
引用
@article{arxiv.2506.06891,
title = {Can In-Context Reinforcement Learning Recover From Reward Poisoning Attacks?},
author = {Paulius Sasnauskas and Yiğit Yalın and Goran Radanović},
journal= {arXiv preprint arXiv:2506.06891},
year = {2025}
}