中文

MoVie:重新审视调制卷积用于视觉计数及更广泛任务

计算机视觉与模式识别 2020-10-08 v3

摘要

本文关注视觉计数,旨在给定自然图像与查询(例如问题或类别)时预测出现次数。与大多数使用显式符号模型且计算昂贵、泛化受限的已有工作不同,我们提出一种简单有效的替代方案,通过重新审视调制卷积在局部融合查询与图像。遵循残差瓶颈的设计,我们称该方法为 MoVie,即 Modulated conVolutional bottlenecks 的缩写。值得注意的是,MoVie 以隐式且整体的方式进行推理,推理时仅需单次前向传播。尽管如此,MoVie 在计数上展现出强劲性能:1) 在推进计数专用 VQA 任务上达到最优水平且更高效;2) 在如 COCO 等困难基准上超越已有工作,用于常见物体计数;3) 当作为通用 VQA 模型中针对'数字'相关问题的模块集成时,助我们获得 2020 VQA 挑战赛第一名。最后,我们展示证据表明诸如 MoVie 的调制卷积可作为超越计数的推理任务的通用机制。

关键词

引用

@article{arxiv.2004.11883,
  title  = {MoVie: Revisiting Modulated Convolutions for Visual Counting and Beyond},
  author = {Duy-Kien Nguyen and Vedanuj Goswami and Xinlei Chen},
  journal= {arXiv preprint arXiv:2004.11883},
  year   = {2020}
}