迈向开放词汇学习:一项综述
计算机视觉与模式识别
2024-02-02 v4 人工智能
摘要
在视觉场景理解领域,深度神经网络已在分割、跟踪和检测等多种核心任务中取得令人瞩目的进展。然而,多数方法基于封闭集假设,即模型只能识别训练集中存在的预定义类别。近来,由于视觉语言预训练快速进展,开放词汇设定被提出。这些新方法旨在定位并识别标注标签空间之外的类别。相较于弱监督与零样本设定,开放词汇方法更通用、实用且有效。本文对开放词汇学习进行全面综述,总结并分析该领域近期进展。具体而言,我们首先将其与零样本学习、开放集识别与分布外检测等相关概念比较。随后,我们回顾分割与检测情形下若干密切相关任务,包括长尾问题、少样本与零样本设定。在方法综述中,我们首先给出封闭集下检测与分割的基础知识作为预备知识。接着,我们考察开放词汇学习所用的多种场景,识别通用设计要素与核心思想。然后,我们在常用数据集与基准上比较近期检测与分割方法。最后,我们总结见解、问题并讨论未来研究方向。据我们所知,这是首篇开放词汇学习的全面文献综述。我们在 https://github.com/jianzongwu/Awesome-Open-Vocabulary 持续追踪相关工作。
引用
@article{arxiv.2306.15880,
title = {Towards Open Vocabulary Learning: A Survey},
author = {Jianzong Wu and Xiangtai Li and Shilin Xu and Haobo Yuan and Henghui Ding and Yibo Yang and Xia Li and Jiangning Zhang and Yunhai Tong and Xudong Jiang and Bernard Ghanem and Dacheng Tao},
journal= {arXiv preprint arXiv:2306.15880},
year = {2024}
}
备注
Accepted by IEEE T-PAMI. Project page: https://github.com/jianzongwu/Awesome-Open-Vocabulary