用于语义感知模仿学习的规约引导数据聚合
机器学习
2023-03-31 v1 形式语言与自动机理论
机器人学
摘要
仿真和形式化方法引导的环境采样方面的进展,已使得在包括自动驾驶在内的若干安全关键场景中对机器学习模型进行严格评估成为可能。将这些环境采样技术应用于改进学习模型本身尚未被充分利用。在这项工作中,我们引入了一种新方法,通过利用规约引导采样技术作为在新环境中聚合专家数据的手段,以语义感知的方式改进模仿学习模型。具体而言,我们创建一组形式化规约,将可能环境的空间划分为语义相似的区域,并识别该划分中我们学习的模仿与专家行为差异最大的元素。然后我们在这些识别出的区域中的环境上聚合专家数据,从而更准确地模仿专家的行为语义。我们在 CARLA 驾驶模拟器的一系列实验中实例化了我们的方法,并证明我们的方法得到的模型比用其他环境采样方法学习到的模型更准确。
引用
@article{arxiv.2303.17010,
title = {Specification-Guided Data Aggregation for Semantically Aware Imitation Learning},
author = {Ameesh Shah and Jonathan DeCastro and John Gideon and Beyazit Yalcinkaya and Guy Rosman and Sanjit A. Seshia},
journal= {arXiv preprint arXiv:2303.17010},
year = {2023}
}
备注
8 pages, under review