中文

从观测与示例中进行离线模仿的简单解法:可处理可能不完整的轨迹

机器学习 2023-11-03 v1 人工智能

摘要

从观测的离线模仿旨在求解仅提供任务特定专家状态和任务无关非专家状态-动作对的MDP。离线模仿在任意交互代价高昂且专家动作不可用的真实场景中有用。最先进的“分布校正估计”(DICE)方法最小化专家与学习策略间状态占有率的散度,并通过加权行为克隆恢复策略;然而,由于对偶域中非鲁棒的优化,它们从不完整轨迹学习时结果不稳定。为解决该问题,本文提出轨迹感知从观测模仿学习(TAILO)。TAILO使用沿未来轨迹的折扣和作为加权行为克隆的权重。该和的各项由旨在识别专家状态的判别器输出缩放。尽管简单,若存在任务无关数据中的专家行为轨迹或片段(先前工作的常见假设),TAILO表现良好。在多个测试平台的实验中,我们发现TAILO更鲁棒有效,尤其在不完整轨迹下。

关键词

引用

@article{arxiv.2311.01329,
  title  = {A Simple Solution for Offline Imitation from Observations and Examples with Possibly Incomplete Trajectories},
  author = {Kai Yan and Alexander G. Schwing and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2311.01329},
  year   = {2023}
}

备注

35 pages; Accepted as a poster for NeurIPS2023