中文

TarGF:无需显式目标指定的目标梯度场学习以重排物体

机器学习 2023-01-18 v4 人工智能

摘要

物体重排是指将物体从初始状态移动到目标状态。在此,我们关注物体重排中一种更实际的设定,即在没有显式目标指定的情况下,将物体从打乱的布局重排为规范的目标分布。然而,这对AI智能体而言仍具挑战性,因为难以描述目标分布(目标指定)以进行奖励工程,或收集专家轨迹作为示范。因此,直接采用强化学习或模仿学习算法来解决该任务并不可行。本文旨在仅利用来自目标分布的一组样本而非手工设计的奖励函数来搜索策略。我们采用得分匹配目标来训练目标梯度场(TarGF),该场给出每个物体上用以增加目标分布可能性的方向。对于物体重排,TarGF可通过两种方式使用:1) 基于模型的规划中,我们可以将目标梯度转化为参考控制,并通过分布式路径规划器输出动作;2) 无模型的强化学习中,TarGF不仅用于估计似然变化作为奖励,还在残差策略学习中提供建议动作。在球体与房间重排中的实验结果表明,我们的方法在终态质量、控制过程效率和可扩展性方面均显著优于最先进的(state-of-the-art)方法。

关键词

引用

@article{arxiv.2209.00853,
  title  = {TarGF: Learning Target Gradient Field to Rearrange Objects without Explicit Goal Specification},
  author = {Mingdong Wu and Fangwei Zhong and Yulong Xia and Hao Dong},
  journal= {arXiv preprint arXiv:2209.00853},
  year   = {2023}
}