拆解任务:一种用于视觉与语言决策的单位粒度混合训练框架
计算机视觉与模式识别
2023-07-18 v1 人工智能
摘要
视觉语言决策(VLDM)是一项具有挑战性的多模态任务。智能体须理解复杂的人类指令,并完成涉及环境导航与物体操作的组合任务。然而,VLDM中涉及的长动作序列使该任务难以学习。从环境视角出发,我们发现任务片段可划分为细粒度的\textit{单位},每个单位包含导航阶段与交互阶段。由于单位内环境保持不变,我们提出了一种新颖的混合训练框架,可在环境中主动探索并减轻暴露偏差。该框架利用了单位粒度配置且与模型无关。具体而言,我们设计了具有内在循环状态的Unit-Transformer(UT),以维持单位尺度的跨模态记忆。通过在TEACH基准上的大量实验,我们证明了所提框架在所有评价指标上均优于现有最优方法。总体而言,我们的工作通过将VLDM任务拆解为更小、可管理的单位并利用混合训练框架,引入了应对该任务的新途径,从而为多模态决策提供了更灵活有效的解决方案。
引用
@article{arxiv.2307.08016,
title = {Breaking Down the Task: A Unit-Grained Hybrid Training Framework for Vision and Language Decision Making},
author = {Ruipu Luo and Jiwen Zhang and Zhongyu Wei},
journal= {arXiv preprint arXiv:2307.08016},
year = {2023}
}