中文

基于跨模态注意力的柔性对象抓取强化学习方法

机器学习 2026-04-24 v1 计算机视觉与模式识别

摘要

我们考虑使用机器人抓取器对具有柔软外壳的可变形物体进行抓取的问题。此类物体的质心会动态变化且易碎,因而机器人在执行操作任务时难以生成恰当的控制输入以避免将其掉落或损坏。多模态感知数据可通过从视觉数据中获取的全局信息(如形状、姿态)以及从触觉数据中获取的接触点周围的局部信息(如压力)来理解抓取状态。尽管它们携带互补信息,对联合使用大有益处,但由于其性质差异,融合它们仍然困难。我们提出一种基于深度强化学习(DRL)的方法,从视觉-触觉感知信息中生成简单抓手的控制输入。该方法在编码器网络中采用跨模态注意力模块,并通过强化学习智能体的损失函数进行自监督训练。通过多模态融合,该方法能够从视觉-触觉感知数据中学习DRL智能体的表示。实验结果表明,跨模态注意力在包括未见过的机器人运动和物体的不同环境中,均优于其他早期和晚期数据融合方法。

关键词

引用

@article{arxiv.2504.15594,
  title  = {Analytical Softmax Temperature Setting from Feature Dimensions for Model- and Domain-Robust Classification},
  author = {Tatsuhito Hasegawa and Shunsuke Sakai},
  journal= {arXiv preprint arXiv:2504.15594},
  year   = {2026}
}

备注

22 pages, 11 figures, under review