中文

克服开放式视觉计数中的统计捷径

计算机视觉与模式识别 2020-07-02 v2 计算与语言 机器学习 图像与视频处理

摘要

机器学习模型往往过度依赖统计捷径。这些输入部分与输出标签之间的伪相关在真实世界场景中并不成立。我们针对近期的开放式视觉计数任务研究此问题,该任务非常适合用于研究统计捷径。我们的目标是开发无论输出标签如何都能学习到恰当计数机制的模型。首先,我们提出修改计数分布(MCD)协议,它对过度依赖统计捷径的模型进行惩罚。该协议基于不遵循相同计数标签分布的训练集与测试集对,例如奇偶集合。直观上,在奇数上学习到恰当计数机制的模型应当在偶数上表现良好。其次,我们引入空间计数网络(SCN),它专门用于基于自然语言问题的视觉分析与计数。我们的模型选取相关图像区域,通过融合与自注意力机制对其打分,并给出最终计数分数。我们在近期数据集 TallyQA 上应用我们的协议,并展示出优于最先进模型(SOTA)的性能。我们还证明了我们的模型能够选择图像中正确的待计数实例。代码与数据集可用:https://github.com/cdancette/spatial-counting-network

关键词

引用

@article{arxiv.2006.10079,
  title  = {Overcoming Statistical Shortcuts for Open-ended Visual Counting},
  author = {Corentin Dancette and Remi Cadene and Xinlei Chen and Matthieu Cord},
  journal= {arXiv preprint arXiv:2006.10079},
  year   = {2020}
}

备注

17 pages, 8 figures