中文

FOAM:一种用于视觉与语言导航的跟随者感知说话者模型

计算与语言 2022-06-10 v1

摘要

说话者-跟随者模型已被证明在视觉与语言导航中是有效的,其中说话者模型用于合成新的指令以扩充跟随者导航模型的训练数据。然而,在以往的许多方法中,生成的指令并未直接训练以优化跟随者的性能。在本文中,我们提出\textsc{foam},一种\textsc{Fo}llower-\textsc{a}ware speaker \textsc{M}odel(跟随者感知说话者模型),该模型根据跟随者反馈持续更新,从而使生成的指令更契合跟随者当前的学习状态。具体而言,我们使用双层优化框架来优化说话者,并通过在标注数据上评估跟随者来获取其训练信号。在 Room-to-Room 和 Room-across-Room 数据集上的实验结果表明,我们的方法在不同设置下均优于强基线模型。分析还表明,我们生成的指令质量高于基线。

关键词

引用

@article{arxiv.2206.04294,
  title  = {FOAM: A Follower-aware Speaker Model For Vision-and-Language Navigation},
  author = {Zi-Yi Dou and Nanyun Peng},
  journal= {arXiv preprint arXiv:2206.04294},
  year   = {2022}
}

备注

NAACL 2022