中文

视觉问答模型中的显式偏差发现

计算机视觉与模式识别 2018-11-20 v1

摘要

研究者已观察到视觉问答(VQA)模型倾向于通过学习数据中的统计偏差来回答问题。例如,其对“草是什么颜色?”的回答通常为“绿色”,而像“书的标题是什么?”这样的问题则无法通过推断统计偏差来回答。明确发现此类偏差对学界而言颇具意义,既有助于理解此类模型的行为,也利于对其调试。我们的工作致力于解决该问题。我们在数据库中存储问题词、答案词以及注意力图中对应感兴趣区域的视觉词。通过在该数据库上运行简单的规则挖掘算法,我们发现了人类可解释的规则,这些规则使我们能独特洞察此类模型的行为。我们的结果也展示了模型在尝试 VQA 任务时所学习到的异常行为示例。

关键词

引用

@article{arxiv.1811.07789,
  title  = {Explicit Bias Discovery in Visual Question Answering Models},
  author = {Varun Manjunatha and Nirat Saini and Larry S. Davis},
  journal= {arXiv preprint arXiv:1811.07789},
  year   = {2018}
}