基于延迟反馈的测试时扰动学习:面向视觉语言动作模型
计算机视觉与模式识别
2026-04-21 v1
摘要
视觉语言动作模型(VLAs)在序列决策中取得了显著的性能,但对细微的环境变化仍然脆弱,例如物体姿态的小变化。我们认为这种脆弱性源于轨迹过拟合,即 VLAs 对动作与实体之间的虚假关联过度关注,然后复现记忆中的动作模式。我们提出了一种基于延迟反馈的测试时扰动学习(PDF),这是一种无需微调基础模型即可提升决策性能的验证器-free 测试时适应框架。PDF 通过不确定性基于的数据增强和动作投票来缓解虚假关联,同时通过自适应调度器分配增强预算以平衡性能和效率。为进一步提高稳定性,PDF 学习一个轻量级扰动模块,依据延迟反馈对动作逻辑进行回溯调整,从而纠正过度自信的问题。在 LIBERO(+7.4% 成功率)和 Atari(+10.3 人类标准分数)上的实验表明,PDF 在任务成功率上 consistently 优于 vanilla VLA 和带测试时适应的 VLA,为多模态决策代理的可靠测试时适应提供了一条实用路径。代码已公开 https://github.com/zhoujiahuan1991/CVPR2026-PDF。
引用
@article{arxiv.2604.18107,
title = {Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models},
author = {Zehua Zang and Xi Wang and Fuchun Sun and Xiao Xu and Lixiang Lium and Jiahuan Zhou and Jiangmeng Li},
journal= {arXiv preprint arXiv:2604.18107},
year = {2026}
}
备注
12 pages, 7 figures, 5 tables