MDETR——面向端到端多模态理解的调制式检测
计算机视觉与模式识别
2021-10-13 v2 计算与语言
机器学习
摘要
多模态推理系统依赖预训练的目标检测器从图像中提取感兴趣区域。然而,这一关键模块通常作为黑盒使用,独立于下游任务训练,且基于固定的物体与属性词表。这使得此类系统难以捕捉自由文本中所表达的长尾视觉概念。本文提出 MDETR,一种端到端调制式检测器,可根据原始文本查询(如图像描述或问题)对图像中的物体进行检测。我们采用基于 transformer 的架构,在模型早期阶段融合两种模态,对文本与图像进行联合推理。我们在从已有多模态数据集中挖掘的 130 万文本-图像对上预训练网络,这些数据集具有文本短语与图像物体之间的显式对齐。随后我们在短语定位、指代表达理解与分割等多个下游任务上微调,在常用基准上取得 SOTA 结果。我们还研究了在少样本设定下微调时,本模型作为给定标签集上物体检测器的效用。我们表明,我们的预训练方法为处理标注实例极少的物体类别长尾问题提供了一种途径。我们的方法可轻松扩展至视觉问答,在 GQA 和 CLEVR 上取得有竞争力的性能。代码与模型见 https://github.com/ashkamath/mdetr。
引用
@article{arxiv.2104.12763,
title = {MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding},
author = {Aishwarya Kamath and Mannat Singh and Yann LeCun and Gabriel Synnaeve and Ishan Misra and Nicolas Carion},
journal= {arXiv preprint arXiv:2104.12763},
year = {2021}
}