中文

针对基于奖励机强化学习的对抗攻击

机器学习 2023-11-16 v1 人工智能 密码学与安全

摘要

近年来,奖励机(Reward Machines, RMs)作为一种简单而有效的基于自动机的 formalism,在强化学习环境中脱颖而出,用于揭示和利用任务结构。尽管它们具有重要意义,但由于其在文献中出现的较晚,很少有人关注其安全含义以及对对抗场景的鲁棒性。通过我的论文,我旨在提供首个针对基于 RM 的强化学习技术的安全性分析,希望借此推动该领域的进一步研究,并且我提出并评估了一类针对基于 RM 技术的新型攻击:致盲攻击(blinding attacks)。

关键词

引用

@article{arxiv.2311.09014,
  title  = {Adversarial Attacks to Reward Machine-based Reinforcement Learning},
  author = {Lorenzo Nodari},
  journal= {arXiv preprint arXiv:2311.09014},
  year   = {2023}
}

备注

Thesis Supervisor: Prof. Federico Cerutti (Universit\`a degli Studi di Brescia, IT)