中文

面向可泛化具身智能体的视觉-语言预训练中的可证明有序性与连续性

机器人学 2025-12-19 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

在人类动作视频上预训练视觉-语言表征已成为一种有前景的方法,可减少训练具身智能体对大规模专家演示的依赖。然而,先前的方法通常采用基于目标达成启发式的时间对比学习,逐步将语言指令从初始帧对齐到最终帧。这种对未来帧的过度强调可能导致错误的视觉-语言关联,因为动作可能提前终止或在结尾包含无关时刻。为了解决这个问题,我们提出了动作时序连贯性学习(AcTOL),以学习有序且连续的视觉-语言表征,无需严格的基于目标的约束。AcTOL 将视频视为一条连续轨迹,其中它 (1) 对比帧间的语义差异以反映其自然顺序,并且 (2) 施加局部布朗桥约束以确保中间帧之间的平滑过渡。在模拟和真实机器人上的大量模仿学习实验表明,预训练的特征显著增强了下游操作任务,并对指令的不同语言风格具有高鲁棒性,为通向泛化具身智能体提供了一条可行路径。

关键词

引用

@article{arxiv.2502.01218,
  title  = {Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents},
  author = {Zhizhen Zhang and Lei Zhu and Zhen Fang and Zi Huang and Yadan Luo},
  journal= {arXiv preprint arXiv:2502.01218},
  year   = {2025}
}

备注

NeurIPS 2025 Poster