中文

P $\approx$ NP,至少在视觉问答中是如此

计算机视觉与模式识别 2020-03-30 v2

摘要

近年来,视觉问答(VQA)领域的进展很大程度上由公开挑战与大型数据集推动。其中使用最广泛的之一是 VQA 2.0 数据集,由极性(“是/否”)与非极性问题组成。观察所有答案上的问题分布,我们发现“是”与“否”答案占问题的 38%,而其余 62% 分散于超过 3000 个其余答案中。尽管该领域已考察若干偏差来源,此类极性相对于非极性问题的过度表征之影响仍不清楚。在本文中,我们度量当极性样本与非极性样本联合用于训练一个基线 VQA 分类器时的潜在混淆因素,并将其与从训练中排除极性问题过度表征的上界进行比较。此外,我们进行交叉实验以分析特征空间的对齐程度。与预期相反,我们未发现非平衡类别联合训练中存在适得其反效应的证据。事实上,通过探索视觉-文本嵌入的中间特征空间,我们发现极性问题的特征空间已编码了足以回答许多非极性问题的结构。我们的结果表明极性(P)与非极性(NP)特征空间高度对齐,故有表述 P \approx NP。

关键词

引用

@article{arxiv.2003.11844,
  title  = {P $\approx$ NP, at least in Visual Question Answering},
  author = {Shailza Jolly and Sebastian Palacio and Joachim Folz and Federico Raue and Joern Hees and Andreas Dengel},
  journal= {arXiv preprint arXiv:2003.11844},
  year   = {2020}
}