中文

解耦框提议与特征化并结合超细粒度语义标签改进图像描述与视觉问答

计算与语言 2019-09-06 v1 计算机视觉与模式识别

摘要

目标检测在当前视觉与语言任务(如图像描述和视觉问答)的解决方案中有重要作用。然而,诸如 Faster R-CNN 等流行模型依赖于为边界框及其对应语义标签标注真值的昂贵过程,使其作为迁移学习的原语任务不太适用。在本文中,我们考察了为下游任务解耦框提议与特征化的效果。关键洞察是,这使我们能够利用大量先前在标准目标检测基准中不可用的标注注释。经验上,我们证明这带来了有效的迁移学习,并改进了图像描述和视觉问答模型,这一点在公开可用基准上得到了度量。

关键词

引用

@article{arxiv.1909.02097,
  title  = {Decoupled Box Proposal and Featurization with Ultrafine-Grained Semantic Labels Improve Image Captioning and Visual Question Answering},
  author = {Soravit Changpinyo and Bo Pang and Piyush Sharma and Radu Soricut},
  journal= {arXiv preprint arXiv:1909.02097},
  year   = {2019}
}

备注

The 2019 Conference on Empirical Methods in Natural Language Processing (EMNLP 2019)