中文

视觉前瞻视觉-语言-动作模型的测试时训练

计算机视觉与模式识别 2026-05-12 v1 机器学习 机器人学

摘要

视觉前瞻视觉-语言-动作模型(VF-VLA)因其卓越性能而成为近期视觉-语言-动作模型中的热门架构选择。然而,VF-VLA 的固有设计使其对分布外(OOD)扰动尤其脆弱。由于动作质量直接依赖于预测未来视觉信息的准确性,OOD 条件会同时影响两个阶段。为解决这一脆弱性,我们提出测试时训练视觉前瞻视觉-语言-动作模型(T3T^3VF),其灵感来自预测的未来图像与随后观测到的图像形成自然监督配对。为进一步解决盲目测试时更新所带来的实际挑战,我们引入自适应更新过滤机制。实验表明,T3T^3VF 在不需任何架构修改或额外模块的情况下,以适度的推理成本缓解了 VF-VLA 的 OOD 脆弱性。

关键词

引用

@article{arxiv.2605.08215,
  title  = {Test-Time Training for Visual Foresight Vision-Language-Action Models},
  author = {Sangwu Park and Wonjoong Kim and Yeonjun In and Sein Kim and Hongseok Kang and Chanyoung Park},
  journal= {arXiv preprint arXiv:2605.08215},
  year   = {2026}
}

备注

Preprint. Under review