中文

文本引导的零样本目标定位

计算机视觉与模式识别 2024-11-19 v1

摘要

目标定位是计算机视觉领域的一个热点问题,旨在从图像或视频中识别并确定特定目标的精确位置。现有的大多数目标定位方法严重依赖大量的标注数据,这些数据标注成本高昂且限制了其适用性。因此,我们提出了一种新的零样本目标定位(ZSOL)框架来解决上述挑战。在所提出的框架中,我们引入了对比语言-图像预训练(CLIP)模块,该模块可以有效地整合视觉和语言信息。此外,我们设计了一个文本自相似性匹配(TSSM)模块,该模块通过增强 CLIP 模块提取的文本特征的表示来提高定位精度。因此,所提出的框架可以在没有标注样本的情况下,由提示词引导来识别和定位图像中的特定目标。大量的实验结果表明,所提出的方法能显著提升定位性能,并为后续研究建立了一个有效的基准。

关键词

引用

@article{arxiv.2411.11357,
  title  = {Text-guided Zero-Shot Object Localization},
  author = {Jingjing Wang and Xinglin Piao and Zongzhi Gao and Bo Li and Yong Zhang and Baocai Yin},
  journal= {arXiv preprint arXiv:2411.11357},
  year   = {2024}
}