中文

AIGeN:一种用于视觉语言导航中指令生成的对抗性方法

计算机视觉与模式识别 2024-04-17 v1 人工智能 计算与语言 机器人学

摘要

在过去几年中,对视觉语言导航(VLN)的研究兴趣显著增长。VLN是一项具有挑战性的任务,涉及智能体遵循人类指令并在先前未知的环境中导航以达到指定目标。近期文献中的工作侧重于利用合成训练数据,通过不同方式扩充可用的指令数据集,以提高导航性能。在这项工作中,我们提出了AIGeN,这是一种受生成对抗网络(GANs)启发的新型架构,能够生成有意义且结构良好的合成指令,以提升导航智能体的性能。该模型由一个Transformer解码器(GPT-2)和一个Transformer编码器(BERT)组成。在训练阶段,解码器为描述智能体到达特定点路径的图像序列生成句子,而编码器则判别真实指令与虚假指令。在实验上,我们评估了生成指令的质量并进行了广泛的消融研究。此外,我们使用AIGeN在Habitat-Matterport 3D数据集(HM3D)上为217K条轨迹生成了合成指令,并展示了一种现成的VLN方法在性能上的提升。我们提案的验证分析在REVERIE和R2R上进行,凸显了我们提案中具有前景的方面,达到了当前最优性能。

引用

@article{arxiv.2404.10054,
  title  = {AIGeN: An Adversarial Approach for Instruction Generation in VLN},
  author = {Niyati Rawal and Roberto Bigazzi and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2404.10054},
  year   = {2024}
}

备注

Accepted to 7th Multimodal Learning and Applications Workshop (MULA 2024) at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024