UFineBench:面向超细粒度的文本行人检索
计算机视觉与模式识别
2024-06-07 v6
摘要
现有的基于文本的行人检索数据集通常具有相对粗粒度的文本标注。这阻碍了模型在真实场景中理解查询文本的细粒度语义。为解决此问题,我们贡献了一个名为\textbf{UFineBench}的新基准,用于超细粒度的文本行人检索。首先,我们构建了一个名为UFine6926的新\textbf{数据集}。我们收集了大量行人图像,并手动为每张图像标注了两条详细的文本描述,平均每条80.8个单词。平均单词数是先前数据集的3到4倍。除了标准的域内评估外,我们还提出了一种更代表真实场景的特殊\textbf{评估范式}。它包含一个新的评估集,具有跨域、跨文本粒度和跨文本风格的特点,名为UFine3C,以及一个新的评估指标,用于准确衡量检索能力,名为平均相似度分布(mSD)。此外,我们提出了CFAM,一种更高效的\textbf{算法},专门为超细粒度文本的行人检索设计。它通过采用共享的跨模态粒度解码器和难负样本匹配机制实现了细粒度挖掘。通过标准域内评估,CFAM在各种数据集上建立了有竞争力的性能,尤其是在我们的超细粒度UFine6926上。此外,通过在UFine3C上的评估,我们证明与其他粗粒度数据集相比,在我们的UFine6926上训练显著提高了对真实场景的泛化能力。数据集和代码将在\url{https://github.com/Zplusdragon/UFineBench}公开。
引用
@article{arxiv.2312.03441,
title = {UFineBench: Towards Text-based Person Retrieval with Ultra-fine Granularity},
author = {Jialong Zuo and Hanyu Zhou and Ying Nie and Feng Zhang and Tianyu Guo and Nong Sang and Yunhe Wang and Changxin Gao},
journal= {arXiv preprint arXiv:2312.03441},
year = {2024}
}