中文

DADAgger:基于分歧增强的数据集聚合

机器学习 2023-01-05 v1 人工智能 机器人学

摘要

DAgger是一种模仿算法,通过在训练期间对所有遇到的样本查询专家来聚合其原始数据集。为了减少查询样本的数量,我们提出对DAgger的一种改进,称为DADAgger,它仅对分布外(OOD)的状态-动作对查询专家。OOD状态通过测量模型集成在每个状态上动作预测的方差来识别,我们使用dropout来模拟该集成。在Car Racing和Half Cheetah环境上的测试取得了与DAgger相当的性能,但减少了专家查询,并且优于随机采样基线。我们还表明,我们的算法可用于构建高效、均衡的训练数据集:从无初始数据开始运行,仅查询专家以解决不确定性。

关键词

引用

@article{arxiv.2301.01348,
  title  = {DADAgger: Disagreement-Augmented Dataset Aggregation},
  author = {Akash Haridas and Karim Hamadeh and Samarendra Chandan Bindu Dash},
  journal= {arXiv preprint arXiv:2301.01348},
  year   = {2023}
}

备注

Imitation Learning for Robotics