带迭代反馈的移动应用任务(MoTIF):解决交互式视觉环境中的任务可行性
计算与语言
2021-04-20 v1 计算机视觉与模式识别
摘要
近年来,视觉-语言研究已转向需要更复杂推理的任务,如交互式问答、视觉常识推理以及问答合理性预测。然而,用于这些问题的数据集未能捕捉真实输入与多模态环境的复杂性,例如模糊的自然语言请求与多样的数字领域。我们引入带迭代反馈的移动应用任务(MoTIF),一个包含自然语言指令、涵盖迄今最多交互式环境的数据集。MoTIF首个包含针对不可满足交互式环境的自然语言请求,我们在此子集上获取后续问题以赋能任务不确定性消解的研究。我们进行了初步的可行性分类实验,仅达到37.3的F1分数,验证了需要更丰富的视觉-语言表示与改进的架构来推理任务可行性。
引用
@article{arxiv.2104.08560,
title = {Mobile App Tasks with Iterative Feedback (MoTIF): Addressing Task Feasibility in Interactive Visual Environments},
author = {Andrea Burns and Deniz Arsan and Sanjna Agrawal and Ranjitha Kumar and Kate Saenko and Bryan A. Plummer},
journal= {arXiv preprint arXiv:2104.08560},
year = {2021}
}
备注
Accepted at the workshop on Visually Grounded Interaction and Language (ViGIL) at NAACL 2021