视觉前瞻视觉-语言-动作模型的测试时训练
计算机视觉与模式识别
2026-05-12 v1 机器学习
机器人学
摘要
视觉前瞻视觉-语言-动作模型(VF-VLA)因其卓越性能而成为近期视觉-语言-动作模型中的热门架构选择。然而,VF-VLA 的固有设计使其对分布外(OOD)扰动尤其脆弱。由于动作质量直接依赖于预测未来视觉信息的准确性,OOD 条件会同时影响两个阶段。为解决这一脆弱性,我们提出测试时训练视觉前瞻视觉-语言-动作模型(VF),其灵感来自预测的未来图像与随后观测到的图像形成自然监督配对。为进一步解决盲目测试时更新所带来的实际挑战,我们引入自适应更新过滤机制。实验表明,VF 在不需任何架构修改或额外模块的情况下,以适度的推理成本缓解了 VF-VLA 的 OOD 脆弱性。
关键词
引用
@article{arxiv.2605.08215,
title = {Test-Time Training for Visual Foresight Vision-Language-Action Models},
author = {Sangwu Park and Wonjoong Kim and Yeonjun In and Sein Kim and Hongseok Kang and Chanyoung Park},
journal= {arXiv preprint arXiv:2605.08215},
year = {2026}
}
备注
Preprint. Under review