中文

通过指定答案分布熵重新表述视觉问题

计算机视觉与模式识别 2020-12-02 v1

摘要

视觉问答(VQA)是一项对由问题与图像组成的视觉问题进行回答的任务。有些视觉问题存在歧义,有些则清晰明确,且根据情境不同,改变问题歧义程度或许是恰当的。然而,此前尚无任何工作涉及该问题。我们提出一项新任务:通过控制问题的歧义程度来重新表述问题。视觉问题的歧义由 VQA 模型预测的答案分布之熵来定义。所提模型对给定图像下的源问题进行重新表述,使重构后的问题具有用户指定的歧义(或熵)。我们提出两种学习策略,利用不含歧义信息的 VQA v2 数据集训练所提模型。我们展示了该方法能够控制重构问题歧义程度的优势,并观察到一个有趣现象:增加歧义比减少歧义更难。

关键词

引用

@article{arxiv.2004.04963,
  title  = {Rephrasing visual questions by specifying the entropy of the answer distribution},
  author = {Kento Terao and Toru Tamaki and Bisser Raytchev and Kazufumi Kaneda and Shun'ichi Satoh},
  journal= {arXiv preprint arXiv:2004.04963},
  year   = {2020}
}

备注

10 pages