中文

改进开放词汇检测中特征对齐的三种方法

计算机视觉与模式识别 2023-03-24 v1 人工智能 机器学习

摘要

零样本开放词汇检测的核心问题是如何对齐视觉与文本特征,使检测器在未见类上表现良好。先前的方法从零训练特征金字塔和检测头,破坏了预训练期间建立的视觉-文本特征对齐,且难以防止语言模型遗忘未见类。我们提出三种缓解这些问题的方法。首先,采用简单方案增强文本嵌入,防止对训练期间所见少数类的过拟合,同时节省内存与计算。其次,修改特征金字塔网络与检测头以包含可训练门控捷径,鼓励视觉-文本特征对齐并在检测训练开始时保证对齐。最后,使用自训练方法利用更大的图像-文本对语料,从而改进无人工标注边界框的类的检测性能。我们的三种方法在 LVIS 基准的零样本版本上评估,每种都展现出明确且显著的收益。我们的最终网络在 mAP-all 指标上达到新的 SOTA,并在 mAP-rare 上展现竞争性能,以及对 COCO 和 Objects365 的优越迁移能力。

关键词

引用

@article{arxiv.2303.13518,
  title  = {Three ways to improve feature alignment for open vocabulary detection},
  author = {Relja Arandjelović and Alex Andonian and Arthur Mensch and Olivier J. Hénaff and Jean-Baptiste Alayrac and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2303.13518},
  year   = {2023}
}