一个用于未知指令可行性交互式视觉-语言导航的数据集
计算与语言
2022-08-16 v3 计算机视觉与模式识别
人机交互
摘要
视觉-语言导航(VLN)中,智能体在视觉环境中遵循语言指令,其研究一直基于输入指令在环境中完全可行的前提。然而在实践中,由于语言歧义或环境变化,请求可能无法完成。为研究未知指令可行性的 VLN,我们引入了一个新的数据集 Mobile app Tasks with Iterative Feedback(MoTIF),其目标是在移动应用中完成自然语言指令。移动应用提供了一个可扩展的领域来研究 VLN 方法的真实下游用途。此外,移动应用指令为交互式导航提供了指导,因为它们通过点击、输入或滑动产生带有状态变化的动作序列。MoTIF 首个包含了可行性标注,既包含二值可行性标签,也包含任务不可满足原因的细粒度标签。我们进一步为歧义查询收集后续问题,以支持任务不确定性消解的研究。借助我们的数据集,我们提出了可行性预测这一新问题,即利用自然语言指令和多模态应用环境来预测指令可行性。MoTIF 提供了更真实的移动应用数据集,因为它比先前工作包含更多样化的环境、更高层次的目标以及更长的动作序列。我们使用 MoTIF 评估交互式 VLN 方法,量化当前方法对新应用环境的泛化能力,并衡量任务可行性对导航性能的影响。
引用
@article{arxiv.2202.02312,
title = {A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility},
author = {Andrea Burns and Deniz Arsan and Sanjna Agrawal and Ranjitha Kumar and Kate Saenko and Bryan A. Plummer},
journal= {arXiv preprint arXiv:2202.02312},
year = {2022}
}
备注
Accepted at the European Conference on Computer Vision (ECCV) 2022. This is a new version of the paper with additional experimental results and a few prior implementation bugs fixed