基于多模态反馈的可行性感知从观察中学习模仿行为
机器人学
2026-02-18 v1
摘要
从示意者运动通过手持演示界面学习机器人控制策略的模仿学习框架受到日益关注。然而,由于示意者与机器人之间物理特性的差异,这种方法面临两个限制:i) 演示数据不包括机器人动作,ii) 示意的运动可能对机器人不可行。这两个限制使得策略学习困难。为此,我们提出了可行性感知行为克隆从观察 (FABCO)。FABCO 将从观察中进行的行为克隆结合机器人动力学模型来补充机器人动作,与可行性估计相结合。在可行性估计中,使用从机器人执行数据中学习的机器人动力学模型来评估示意运动在机器人动力学下的可重复性。所估计的可行性用于多模态反馈和可行性感知的策略学习,以改进示意者的运动并学习稳健的策略。多模态反馈通过示意者的视觉和触觉感知为可行性提供反馈,以促进可行的示意运动。可行性感知的策略学习减少了对机器人不可行的示意运动的影响,使能够学习机器人可稳定执行的策略。我们对 15 名参与者在两个任务上的实验表明,FABCO 比没有可行性反馈的情况下的模仿学习性能提高了超过 3.2 倍。
引用
@article{arxiv.2602.15351,
title = {Feasibility-aware Imitation Learning from Observation with Multimodal Feedback},
author = {Kei Takahashi and Hikaru Sasaki and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2602.15351},
year = {2026}
}