时间陷阱:预训练视觉表征在视觉运动策略学习中的纠缠
机器人学
2025-11-17 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
预训练视觉表征(PVR)的集成显著推进了视觉运动策略学习。然而,有效利用这些模型仍然是一个挑战。我们识别出时间纠缠是在序列决策任务中使用这些时间不变模型时的一个关键固有问题。这种纠缠的产生是因为针对静态图像理解优化的PVR难以表征对视觉运动控制至关重要的时间依赖性。在这项工作中,我们量化了时间纠缠的影响,证明了策略的成功率与其潜在空间捕获任务进展线索的能力之间存在强相关性。基于这些见解,我们提出了一个简单而有效的解纠缠基线,旨在缓解时间纠缠。我们的实证结果表明,旨在用时间成分丰富特征的常规方法本身是不够的,这凸显了显式处理时间解纠缠对于鲁棒视觉运动策略学习的必要性。
引用
@article{arxiv.2502.03270,
title = {The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning},
author = {Nikolaos Tsagkas and Andreas Sochopoulos and Duolikun Danier and Chris Xiaoxuan Lu and Oisin Mac Aodha},
journal= {arXiv preprint arXiv:2502.03270},
year = {2025}
}
备注
This submission replaces our earlier work "When Pre-trained Visual Representations Fall Short: Limitations in Visuo-Motor Robot Learning." The original paper was split into two studies; this version focuses on temporal entanglement in pre-trained visual representations. The companion paper is "Attentive Feature Aggregation."