基于多模态Transformer的类别无关目标检测
计算机视觉与模式识别
2022-07-20 v6
摘要
什么是物体?这一直是计算机视觉中的一个长期问题。为此,人们开发了众多无学习和基于学习的方法来对物体性(objectness)打分。然而,它们通常不能很好地跨新领域和新物体泛化。在本文中,我们认为现有方法缺乏由人类可理解语义所支配的自顶向下监督信号。我们首次在文献中证明,使用对齐的图像-文本对训练的多模态视觉Transformer(MViT)能够有效弥补这一差距。我们在跨多个领域和新物体上的大量实验显示了MViT在定位图像中通用物体方面的最先进性能。基于现有MViT不包含多尺度特征处理且通常需要更长训练周期的观察,我们开发了一种使用多尺度可变形注意力和晚期视觉-语言融合的高效MViT架构。我们展示了MViT提议在广泛应用中的重要性,包括开放世界目标检测、显著与伪装目标检测、监督和自监督检测任务。此外,MViT能够根据特定语言查询自适应地生成提议,从而提供增强的交互性。代码:\url{https://git.io/J1HPY}。
引用
@article{arxiv.2111.11430,
title = {Class-agnostic Object Detection with Multi-modal Transformer},
author = {Muhammad Maaz and Hanoona Rasheed and Salman Khan and Fahad Shahbaz Khan and Rao Muhammad Anwer and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2111.11430},
year = {2022}
}
备注
Accepted at ECCV 2022