中文

通过自然-对抗边界量化辅助鲁棒性

人工智能 2023-10-17 v1 机器学习 机器人学

摘要

我们的最终目标是为辅助人的机器人构建鲁棒策略。其难点在于,人在测试时可能表现出意料之外的行为,潜在地在训练分布之外与机器人交互并导致失败。即便仅衡量鲁棒性也是一项挑战。对抗扰动是默认手段,但可能给出错误图景:它们可能对应在自然人际交互中不太可能出现的人的动作。一个机器人策略可能在微小对抗扰动下失败,却在大的自然扰动下正常工作。我们提出,在这些交互场景中捕捉鲁棒性需要构建并分析整个自然-对抗边界:即在自然度与低机器人性能之间取得最佳权衡的人策略的 Pareto 前沿。我们引入 RIGID,一种通过训练在最小化机器人奖励与类人行为(由判别器度量)之间权衡的对抗人策略来构建该边界的方法。在一个 Assistive Gym 任务上,我们使用 RIGID 分析标准协作强化学习以及旨在提升鲁棒性的现有方法的性能。我们还将 RIGID 识别的边界与专家对抗交互中识别的失败以及用户交互中自然发生的失败进行比较。总体而言,我们发现证据表明 RIGID 能提供可预测部署性能的 meaningful 鲁棒性度量,并揭示出人机交互中难以手动发现的失败案例。https://ood-human.github.io。

关键词

引用

@article{arxiv.2310.10610,
  title  = {Quantifying Assistive Robustness Via the Natural-Adversarial Frontier},
  author = {Jerry Zhi-Yang He and Zackory Erickson and Daniel S. Brown and Anca D. Dragan},
  journal= {arXiv preprint arXiv:2310.10610},
  year   = {2023}
}