中文

PASTS:面向视觉与语言导航的进度感知时空 Transformer 讲述器

计算机视觉与模式识别 2024-03-07 v1

摘要

视觉与语言导航(VLN)是一项关键但具挑战性的跨模态导航任务。增强 VLN 泛化性能的一种有力技术是使用独立的讲述器模型为数据增强提供伪指令。然而,当前基于长短期记忆(LSTM)的讲述器模型缺乏关注不同位置与时间步相关特征的能力。为此,我们提出一种新颖的进度感知时空 Transformer 讲述器(PASTS)模型,以 Transformer 作为网络核心。PASTS 使用时空编码器融合全景表示并通过步数编码中间连接。此外,为避免可能导致错误监督的错位问题,提出讲述器进度监视器(SPM)使模型能估计指令生成进度并促进更细粒度的描述结果。另外,引入多特征丢弃(MFD)策略以缓解过拟合。所提 PASTS 可灵活地与现有 VLN 模型结合。实验结果表明,PASTS 优于所有现有讲述器模型,并成功提升先前 VLN 模型性能,在标准 Room-to-Room(R2R)数据集上取得最先进性能。

关键词

引用

@article{arxiv.2305.11918,
  title  = {PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation},
  author = {Liuyi Wang and Chengju Liu and Zongtao He and Shu Li and Qingqing Yan and Huiyi Chen and Qijun Chen},
  journal= {arXiv preprint arXiv:2305.11918},
  year   = {2024}
}

备注

15 pages, 11 figures