针对基于奖励机强化学习的对抗攻击
机器学习
2023-11-16 v1 人工智能
密码学与安全
摘要
近年来,奖励机(Reward Machines, RMs)作为一种简单而有效的基于自动机的 formalism,在强化学习环境中脱颖而出,用于揭示和利用任务结构。尽管它们具有重要意义,但由于其在文献中出现的较晚,很少有人关注其安全含义以及对对抗场景的鲁棒性。通过我的论文,我旨在提供首个针对基于 RM 的强化学习技术的安全性分析,希望借此推动该领域的进一步研究,并且我提出并评估了一类针对基于 RM 技术的新型攻击:致盲攻击(blinding attacks)。
引用
@article{arxiv.2311.09014,
title = {Adversarial Attacks to Reward Machine-based Reinforcement Learning},
author = {Lorenzo Nodari},
journal= {arXiv preprint arXiv:2311.09014},
year = {2023}
}
备注
Thesis Supervisor: Prof. Federico Cerutti (Universit\`a degli Studi di Brescia, IT)