InternVLA-A1:面向机器人操作的统一理解、生成与行动
声音
2026-04-28 v2 计算与语言
音频与语音处理
摘要
流行的视觉-语言-动作(VLA)模型通常基于多模态大语言模型(MLLM),在语义理解方面表现卓越,但缺乏推导物理世界动态的能力。因此,最近的研究方法转向使用世界模型,通常通过视频预测来实现;但这些方法常常缺乏语义 grounding,且在视频预测误差存在时表现脆弱。为了协同语义理解与动态预测能力,我们提出InternVLA-A1。该模型采用统一的Mixture-of-Transformers架构,协调三个专家进行场景理解、视觉前瞻生成和动作执行。这些组件通过统一的掩码自注意力机制无缝交互。基于InternVL3和Qwen3-VL,在2B和3B参数规模上实现InternVLA-A1。我们在真实机器人数据、合成仿真数据和人类视频上进行混合训练,覆盖超过6920万帧。这种混合训练策略有效地利用了合成仿真数据的多样性,同时缩小了仿真到现实的鸿沟。在12个真实世界机器人任务和一个仿真基准上进行评估显示,InternVLA-A1在所有任务上都一致优于先前的领先模型:相较于pi0.5,在静态操作任务上提升4.4%,在RoboTwin 2.0仿真基准上提升2.6%,在动态操作任务上提升26.7%。
引用
@article{arxiv.2601.02455,
title = {Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models},
author = {Xinyu Wang and Ziyu Zhao and Yajie Luo and Yihong Wu and Liheng Ma and Jingrui Tian and Lei Ding and Xiao-Wen Chang and Peng Lu},
journal= {arXiv preprint arXiv:2601.02455},
year = {2026}
}
备注
9 pages, 4 figures, 3 tables