基于具身描述的自解释可供性学习
计算机视觉与模式识别
2024-04-09 v1 人工智能
摘要
在视觉可供性学习领域,以往的方法主要使用描绘人类行为模式的大量图像或视频来识别用于物体操作的动作可能区域,在机器人任务中有多种应用。然而,它们遇到了动作模糊的主要挑战,例如是敲打还是携带鼓的模糊性,以及处理复杂场景所涉及的复杂性。此外,人类干预及时纠正机器人错误也很重要。为了解决这些问题,我们引入了带有具身描述的自解释可供性学习(SEA)。这一创新使机器人能够表达其意图,并弥合可解释的视觉-语言描述与视觉可供性学习之间的差距。由于缺乏合适的数据集,我们公布了一个为该任务量身定制的开创性数据集和指标,该数据集集成了图像、热图和具身描述。此外,我们提出了一种新颖的模型,以简单但有效的方式将可供性定位与自解释结合起来。大量的定量和定性实验证明了我们方法的有效性。
引用
@article{arxiv.2404.05603,
title = {Self-Explainable Affordance Learning with Embodied Caption},
author = {Zhipeng Zhang and Zhimin Wei and Guolei Sun and Peng Wang and Luc Van Gool},
journal= {arXiv preprint arXiv:2404.05603},
year = {2024}
}