深度强化学习中行动级后门攻击的通用框架 UNIDOOR
机器学习
2025-01-28 v1 人工智能
密码学与安全
摘要
深度强化学习 (DRL) 在安全关键决策场景中得到广泛应用。然而,DRL 对后门攻击高度脆弱,尤其是行动级后门攻击,通过精确操控和灵活的激活条件,对可能导致车辆碰撞或无人机坠毁等结果构成重大威胁。行动级后门的关键区别在于利用后门奖励函数将触发器与目标动作关联。然而,现有研究通常依赖固定值或条件翻转的后门奖励函数,这些函数在不同 DRL 任务和后门设计之间缺乏通用性,导致实际应用中出现性能波动甚至失败。本文提出首个通用行动级后门攻击框架,称为 UNIDOOR,通过性能监控实现后门奖励函数的自适应探索,消除对专家知识和网格搜索的依赖。我们指出,行动篡改是连续动作场景下行动级后门攻击的关键组成部分,因为它解决了由低频目标动作导致的攻击失败问题。广泛的评估表明,UNIDOOR 显著提升了行动级后门的攻击性能,展示了其在单/多智能体、单/多后门、离散/连续动作空间以及稀疏/稠密奖励信号等多种攻击场景中的通用性。此外,包含状态分布、神经元激活和动画的可视化结果表明了 UNIDOOR 的隐蔽性。UNIDOOR 的源代码可在 https://github.com/maoubo/UNIDOOR 查找。
引用
@article{arxiv.2501.15529,
title = {UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning},
author = {Oubo Ma and Linkang Du and Yang Dai and Chunyi Zhou and Qingming Li and Yuwen Pu and Shouling Ji},
journal= {arXiv preprint arXiv:2501.15529},
year = {2025}
}
备注
21 pages, 12 figures, 7 tables