Retouchdown:将 Touchdown 添加至 StreetLearn 作为街景中语言落地任务的可共享资源
计算机视觉与模式识别
2020-01-14 v1 人工智能
计算与语言
机器学习
摘要
Touchdown 数据集(Chen 等人,2019)提供了人工标注员在纽约市街道中导航以及在给定位置解析空间描述的指令。为使更广泛的研究群体能有效开展 Touchdown 任务,我们公开发布了 Touchdown 所需的 29k 张原始街景全景图。我们遵循 StreetLearn 数据发布(Mirowski 等人,2019)的流程检查全景图中的个人身份信息,并在必要时对其进行模糊处理。这些全景图已添加至 StreetLearn 数据集,并可通过此前用于 StreetLearn 的相同流程获取。我们还提供了两项 Touchdown 任务的参考实现:视觉与语言导航(VLN)和空间描述解析(SDR)。我们将模型结果与 Chen 等人(2019)给出的结果进行比较,表明我们添加至 StreetLearn 的全景图完全支持这两项 Touchdown 任务,并可有效用于进一步研究与对比。
引用
@article{arxiv.2001.03671,
title = {Retouchdown: Adding Touchdown to StreetLearn as a Shareable Resource for Language Grounding Tasks in Street View},
author = {Harsh Mehta and Yoav Artzi and Jason Baldridge and Eugene Ie and Piotr Mirowski},
journal= {arXiv preprint arXiv:2001.03671},
year = {2020}
}