VLASCD:用于同时聊天与决策的视觉语言动作模型
人工智能
2025-08-26 v3
摘要
最新的大规模预训练模型,如 LLM(如 GPT 系列)和 VLA(如 OpenVLA),在多模态任务上取得了显著进展,但建立在多输入单输出(MISO)范式之上。在需要并行任务执行的多输入多输出(MIMO)场景中,该范式根本限制了性能。由于 MISO 架构中,任务竞争共享的输出通道,产生互斥效应,导致优化不平衡和性能下降。为解决这一差距,我们引入 MIMO-VLA(VLASCD),一个统一的训练框架,使能够并行生成多个任务输出,以同时生成对话和决策为例。鼓励人类认知,MIMO-VLA 消除任务之间的干扰,支持高效的并行处理。在 CARLA 自动驾驶平台上的实验表明,MIMO-VLA 在 MIMO 场景下显著优于最新 MISO-based LLM、强化学习模型和 VLA,为多模态和多任务学习开辟了新方向。
引用
@article{arxiv.2410.15885,
title = {VLASCD: A Visual Language Action Model for Simultaneous Chatting and Decision Making},
author = {Zuojin Tang and Bin Hu and Chenyang Zhao and De Ma and Gang Pan and Bin Liu},
journal= {arXiv preprint arXiv:2410.15885},
year = {2025}
}
备注
Accepted by EMNLP 2025 (Main Conference)