开放世界文本指定目标计数
计算机视觉与模式识别
2023-09-19 v2
摘要
我们的目标是对图像进行开放世界目标计数,其中目标对象类别由文本描述指定。为此,我们提出 CounTX,一种类无关的、单阶段模型,在预训练联合文本-图像表征之上使用 transformer 解码计数头。CounTX 仅给定图像和目标任务对象类别的文本描述,即可计数任意类别的实例数量,并能够端到端训练。除该模型外,我们做出如下贡献:(i) 我们将 CounTX 与先前开放世界目标计数工作比较,表明在使用文本指定任务的方法中,我们的方法在 FSC-147 基准的所有指标上均超越当前最优(SOTA);(ii) 我们提出并发布 FSC-147-D,即 FSC-147 的增强版,带有文本描述,从而可用比简单类名更细致的语言描述对象类别。FSC-147-D 与代码见 https://www.robots.ox.ac.uk/~vgg/research/countx。
引用
@article{arxiv.2306.01851,
title = {Open-world Text-specified Object Counting},
author = {Niki Amini-Naieni and Kiana Amini-Naieni and Tengda Han and Andrew Zisserman},
journal= {arXiv preprint arXiv:2306.01851},
year = {2023}
}
备注
BMVC 2023