VQS:将分割与问答相链接以实现 VQA 中的监督注意力及聚焦问题的语义分割
计算机视觉与模式识别
2017-08-17 v1 计算与语言
机器学习
摘要
丰富且密集的人工标注数据集是近期视觉-语言理解取得进展的主要推动因素之一。许多看似无关的标注(例如,语义分割与视觉问答(VQA))在本质上是相互关联的,因为它们揭示了人类对同一视觉场景——甚至是同一组图像(例如 COCO 的图像)——不同层次与视角的理解。COCO 的普及性将这些标注与任务关联起来。显式地将它们链接起来可能会极大地有益于各项独立任务以及统一的视觉与语言建模。我们展示了将 COCO 提供的实例分割与 VQA 数据集中的问答(QA)相链接的初步工作,并将收集到的链接命名为视觉问题与分割答案(VQS)。它们在先前相互独立的任务之间传递人类的监督,为现有问题提供了更有效的杠杆,并为新的研究问题与模型打开了大门。本文研究了 VQS 数据的两个应用:VQA 的监督注意力以及一种新颖的聚焦问题的语义分割任务。对于前者,我们仅通过利用分割-QA 链接作为显式监督学习到的注意力特征来增强多层感知机,便在 VQA 真实多选任务上取得了 SOTA 结果。为了客观审视后者,我们研究了两种合理的方法,并将它们与一种假设在测试阶段给定实例分割的预言机方法进行了比较。
引用
@article{arxiv.1708.04686,
title = {VQS: Linking Segmentations to Questions and Answers for Supervised Attention in VQA and Question-Focused Semantic Segmentation},
author = {Chuang Gan and Yandong Li and Haoxiang Li and Chen Sun and Boqing Gong},
journal= {arXiv preprint arXiv:1708.04686},
year = {2017}
}
备注
To appear on ICCV 2017