中文

面向身份感知的跨模态检索:一个数据集与基线

计算机视觉与模式识别 2025-02-11 v2 信息检索 多媒体

摘要

近期深度学习技术显著提升了基于内容的检索方法,尤其是通过将图像和文本映射到共享嵌入空间的模型(如 CLIP)。然而,这些方法在识别训练数据中缺乏的特定实体和长尾概念时常常难以应对,尤其是在识别特定个人方面。在本文中,我们探索了身份感知跨模态检索任务,即根据自然语言查询检索特定情境下的人员图像。该任务在各种场景中至关重要,例如搜索和浏览由特定个人维护的个人视频集合或由国家广播机构维护的大型音视频档案。在本文中,我们引入了新的数据集 COCO Person FaceSwap(COCO-PFS),该数据集源自广泛使用的 COCO 数据集,并通过 VGGFace2 生成的人脸替换深伪造人脸丰富而成。该数据集解决了用于训练和评估此任务模型的大规模数据集缺乏的问题。我们的实验评估了不同 CLIP 变体针对此任务的性能,包括我们的体系结构——身份感知 CLIP(Id-CLIP),通过针对性微调实现了具竞争力的检索性能。我们的贡献为更健壮的跨模态检索系统奠定了基础,这些系统能够识别长尾身份和情境细微差别。数据和代码均可在 https://github.com/mesnico/IdCLIP 提供。

关键词

引用

@article{arxiv.2412.21009,
  title  = {Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline},
  author = {Nicola Messina and Lucia Vadicamo and Leo Maltese and Claudio Gennaro},
  journal= {arXiv preprint arXiv:2412.21009},
  year   = {2025}
}

备注

Accepted as full paper at ECIR 2025