中文

分而修复:利用选项提升模仿学习在对抗性演示下的性能

机器学习 2023-06-13 v2 人工智能 密码学与安全

摘要

我们考虑从教师或专家给出的演示中学习执行任务的问题,其中部分专家演示可能是对抗性的并展示了错误的任务执行方式。我们提出一种新技术,可识别演示轨迹中未被对抗者显著修改的部分,并利用时序扩展策略(即选项,options)将其用于学习。我们首先基于演示轨迹的时空特征定义轨迹散度度量,以检测并丢弃被对抗专家显著修改、若用于学习会损害学习者性能的轨迹片段。随后我们使用基于选项的算法对轨迹进行划分,仅从被判定为可接受的部分学习。我们给出了该技术的理论结果,表明修复部分轨迹可在不降低学习者性能的前提下提升演示的样本效率。接着我们在存在不同类型与程度对抗攻击的演示轨迹下,评估所提算法学习游玩名为 LunarLander 的 Atari 类计算机游戏的性能。实验结果表明,我们的技术能识别被对抗修改的轨迹部分,并成功防止学习性能因对抗性演示而退化。

关键词

引用

@article{arxiv.2306.04581,
  title  = {Divide and Repair: Using Options to Improve Performance of Imitation Learning Against Adversarial Demonstrations},
  author = {Prithviraj Dasgupta},
  journal= {arXiv preprint arXiv:2306.04581},
  year   = {2023}
}

备注

33 pages, 4 figures, 3 tables