中文

AnyCamVLA: 零样相机适配以实现视觉-语言-动作模型的视点鲁棒性

计算机视觉与模式识别 2026-03-10 v2

摘要

尽管Vision-Language-Action模型(VLA)在机器人操控方面取得了显著进展,但这些大型预训练模型需要部署到特定环境时进行微调。这些微调后的模型对频繁发生的非结构化环境中的相机视点变化极其敏感。在本文中,我们提出了一个无需额外演示数据、策略微调或架构修改的零样相机适配框架。我们的核心思想是实时虚拟调整测试时的相机观察,以匹配训练相机配置。为此,我们采用最近出现的前馈式新视角合成模型,该模型输出高质量的目标视图图像,处理外在参数和内在参数。这种即插即用的方法保留了VLA的预训练能力,可应用于任何基于RGB的策略。通过在LIBERO基准上的广泛实验,我们的方法在使用数据增强进行策略微调或使用额外3D感知特征处理视觉输入的基线之上 consistently 获得优势。我们进一步验证了该方法在实际机器人操控场景中持续提升视点鲁棒性,包括各种相机外参数、内参数以及自由移动手持相机的设置。

关键词

引用

@article{arxiv.2603.05867,
  title  = {TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis},
  author = {Sijing Li and Zhongwei Qiu and Jiang Liu and Wenqiao Zhang and Tianwei Lin and Yihan Xie and Jianxiang An and Boxiang Yun and Chenglin Yang and Jun Xiao and Guangyu Guo and Jiawen Yao and Wei Liu and Yuan Gao and Ke Yan and Weiwei Cao and Zhilin Zheng and Tony C. W. Mok and Kai Cao and Yu Shi and Jiuyu Zhang and Jian Zhou and Beng Chin Ooi and Yingda Xia and Ling Zhang},
  journal= {arXiv preprint arXiv:2603.05867},
  year   = {2026}
}

备注

Accepted at ICLR 2026. 10 pages + appendix