中文

DecisionNCE:通过隐式偏好学习实现具身多模态表示

机器人学 2024-05-27 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

多模态预训练是自主机器人表示学习三大目标的有效策略:1) 提取局部和全局任务进程;2) 强制视觉表示的时间一致性;3) 捕获轨迹级的语言接地。大多数现有方法通过单独的目标来处理这些问题,这往往导致次优解。在本文中,我们提出了一种通用的统一目标,可以同时从图像序列中提取有意义的任务进程信息,并将其与语言指令无缝对齐。我们发现,通过隐式偏好(即视觉轨迹与其对应的语言指令天然地比不匹配的配对更好地对齐),流行的 Bradley-Terry 模型可以通过适当的奖励重参数化转化为表示学习。由此产生的框架 DecisionNCE 镜像了 InfoNCE 风格的目标,但专为决策任务量身定制,提供了一个具身表示学习框架,优雅地提取局部和全局任务进程特征,通过隐式时间对比学习强制时间一致性,同时通过多模态联合编码确保轨迹级指令接地。在仿真机器人和真实机器人上的评估表明,DecisionNCE 有效地促进了多样的下游策略学习任务,为统一表示和奖励学习提供了通用的解决方案。项目主页:https://2toinf.github.io/DecisionNCE/

关键词

引用

@article{arxiv.2402.18137,
  title  = {DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning},
  author = {Jianxiong Li and Jinliang Zheng and Yinan Zheng and Liyuan Mao and Xiao Hu and Sijie Cheng and Haoyi Niu and Jihao Liu and Yu Liu and Jingjing Liu and Ya-Qin Zhang and Xianyuan Zhan},
  journal= {arXiv preprint arXiv:2402.18137},
  year   = {2024}
}

备注

ICML 2024