通过语言层次进行开放词汇目标检测
计算机视觉与模式识别
2024-10-29 v1 人工智能
计算与语言
摘要
关于可泛化目标检测的近期研究因从带有图像级标签的大规模数据集中获取额外弱监督而备受关注。然而,弱监督检测学习常面临图像到边界框标签不匹配的问题,即图像级标签无法传达精确的目标信息。我们设计了语言层次自训练(LHST),将语言层次引入弱监督检测器训练中,以学习更具泛化能力的检测器。LHST 利用语言层次扩展图像级标签,并实现扩展标签与自训练之间的协同正则化。具体而言,扩展标签通过提供更丰富的监督并缓解图像到边界框标签不匹配来正则化自训练,而自训练则允许根据预测的可靠性来评估和选择扩展标签。此外,我们设计了语言层次提示生成,将语言层次引入提示生成中,这有助于弥合训练与测试之间的词汇鸿沟。大量实验表明,所提出的技术在 14 个被广泛研究的目标检测数据集上始终如一地实现了卓越的泛化性能。
引用
@article{arxiv.2410.20371,
title = {Open-Vocabulary Object Detection via Language Hierarchy},
author = {Jiaxing Huang and Jingyi Zhang and Kai Jiang and Shijian Lu},
journal= {arXiv preprint arXiv:2410.20371},
year = {2024}
}
备注
NeurIPS 2024 Camera Ready