中文

Kefa:一种知识增强且细粒度对齐的导航指令生成说话器

计算机视觉与模式识别 2023-07-26 v1

摘要

我们提出了一种用于导航指令生成的新型说话器模型 \textsc{Kefa}。视觉与语言导航中现有的说话器模型受限于不同环境间视觉特征的大领域鸿沟以及时间定位能力不足。为应对这些挑战,我们提出知识精炼模块以借助外部知识事实增强特征表示,并提出自适应时间对齐方法以强化所生成指令与观测序列间的细粒度对齐。此外,我们提出一种用于导航指令评估的新指标 SPICE-D,其能感知方向短语的正确性。在 R2R 与 UrbanWalk 数据集上的实验结果表明,所提出的 KEFA 说话器在室内与室外场景均取得了最先进的指令生成性能。

关键词

引用

@article{arxiv.2307.13368,
  title  = {Kefa: A Knowledge Enhanced and Fine-grained Aligned Speaker for Navigation Instruction Generation},
  author = {Haitian Zeng and Xiaohan Wang and Wenguan Wang and Yi Yang},
  journal= {arXiv preprint arXiv:2307.13368},
  year   = {2023}
}

备注

10 pages, 4 figures