中文

关于视觉与语言导航指令的评估

人工智能 2021-01-27 v1 计算与语言 计算机视觉与模式识别

摘要

视觉与语言导航寻路智能体可通过利用自动生成的导航指令来增强。然而,现有指令生成器尚未被全面评估,且用于开发它们的自动评估指标也未经验证。通过使用人类寻路者,我们表明这些生成器表现与基于模板的生成器相当或仅略好,且远差于人类指导者。此外,我们发现BLEU、ROUGE、METEOR和CIDEr对于评估具身导航指令是无效的。为改进指令评估,我们提出了一种无需参考指令即可运作的指令-轨迹兼容性模型。我们的模型在对单条指令评分时与人类寻路结果表现出最高相关性。对于对指令生成系统排序,若有参考指令可用,我们推荐使用SPICE。

关键词

引用

@article{arxiv.2101.10504,
  title  = {On the Evaluation of Vision-and-Language Navigation Instructions},
  author = {Ming Zhao and Peter Anderson and Vihan Jain and Su Wang and Alexander Ku and Jason Baldridge and Eugene Ie},
  journal= {arXiv preprint arXiv:2101.10504},
  year   = {2021}
}

备注

Accepted to EACL 2021