开放词汇检测与分割综述:过去、现在与未来
计算机视觉与模式识别
2024-04-16 v2
摘要
作为最基础的场景理解任务,目标检测与分割在深度学习时代取得了巨大进展。由于昂贵的人工标注成本,现有数据集中的标注类别往往规模小且预先定义,即最先进的完全监督检测器与分割器无法泛化到封闭词汇之外。为解决此限制,过去几年中,社区对开放词汇检测(OVD)与分割(OVS)的关注日益增加。所谓“开放词汇”,是指模型能对预定义类别之外的物体进行分类。本综述对OVD与OVS的近期进展进行了全面回顾。首先提出一种分类法以组织不同任务与方法。我们发现弱监督信号的许可与使用方式能很好地区分不同方法,包括:视觉-语义空间映射、新视觉特征合成、区域感知训练、伪标注、知识蒸馏与迁移学习。所提分类法跨不同任务通用,涵盖目标检测、语义/实例/全景分割、3D与视频理解。我们深入分析了主要设计原则、关键挑战、发展路径、方法优势与不足。此外,我们在附录中对每项任务及每种方法的关键组件进行了基准测试,并在 https://github.com/seanzhuh/awesome-open-vocabulary-detection-and-segmentation 在线更新。最后,提供并讨论了若干有前景的方向以激发未来研究。
引用
@article{arxiv.2307.09220,
title = {A Survey on Open-Vocabulary Detection and Segmentation: Past, Present, and Future},
author = {Chaoyang Zhu and Long Chen},
journal= {arXiv preprint arXiv:2307.09220},
year = {2024}
}