面向可泛化具身智能体的视觉-语言预训练中的可证明有序性与连续性
机器人学
2025-12-19 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
在人类动作视频上预训练视觉-语言表征已成为一种有前景的方法,可减少训练具身智能体对大规模专家演示的依赖。然而,先前的方法通常采用基于目标达成启发式的时间对比学习,逐步将语言指令从初始帧对齐到最终帧。这种对未来帧的过度强调可能导致错误的视觉-语言关联,因为动作可能提前终止或在结尾包含无关时刻。为了解决这个问题,我们提出了动作时序连贯性学习(AcTOL),以学习有序且连续的视觉-语言表征,无需严格的基于目标的约束。AcTOL 将视频视为一条连续轨迹,其中它 (1) 对比帧间的语义差异以反映其自然顺序,并且 (2) 施加局部布朗桥约束以确保中间帧之间的平滑过渡。在模拟和真实机器人上的大量模仿学习实验表明,预训练的特征显著增强了下游操作任务,并对指令的不同语言风格具有高鲁棒性,为通向泛化具身智能体提供了一条可行路径。
引用
@article{arxiv.2502.01218,
title = {Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents},
author = {Zhizhen Zhang and Lei Zhu and Zhen Fang and Zi Huang and Yadan Luo},
journal= {arXiv preprint arXiv:2502.01218},
year = {2025}
}
备注
NeurIPS 2025 Poster