中文

IMRL:集成视觉、物理、时序与几何表征以提升食物获取性能

机器人学 2025-03-19 v2 人工智能

摘要

机器人辅助喂食具有显著的提升生活质量的潜力,尤其对于饮食障碍者而言。然而,在多样化条件下获取各种食物并实现对未见食物的泛化,带来了独特的挑战。依赖视觉线索(如颜色、形状和纹理)导出的表层几何信息(如边界框和姿态)的方法,往往缺乏适应性和鲁棒性,尤其当食物在物理属性相似但视觉外观不同时。我们采用模仿学习(imitation learning, IL)来学习食物获取策略。现有方法则使用基于 ResNet-50 等离线图像编码器的 IL 或强化学习(RL)来学习策略,但这些表征在适应性和鲁棒性方面不足。为此,我们提出一种新方法,IMRL(Integrated Multi-Dimensional Representation Learning),即集成视觉、物理、时序与几何表征,以提升 IL 在食物获取任务中的鲁棒性和泛化能力。我们的方法捕获食物类型和物理属性(如固体、半固体、颗粒、液体和混合物),建模食物获取动作的时间动态,并引入几何信息以确定最佳取食点并评估碗中剩余量。IMRL 使 IL 能够根据情境自适应调整取食策略,提高机器人处理多样化食物获取情境的能力。在实际机器人实验中,我们的方法在各种食物和碗的配置,包括对未见情境的零样本泛化,展现出良好的鲁棒性和适应性。我们的方法在成功率上相比最佳基线提升了最高可达 35%35\%。更多细节请参见我们的网站 https://ruiiu.github.io/imrl。

关键词

引用

@article{arxiv.2409.12092,
  title  = {IMRL: Integrating Visual, Physical, Temporal, and Geometric Representations for Enhanced Food Acquisition},
  author = {Rui Liu and Zahiruddin Mahammad and Amisha Bhaskar and Pratap Tokekar},
  journal= {arXiv preprint arXiv:2409.12092},
  year   = {2025}
}