基于图的跨域知识蒸馏用于跨数据集文本到图像人物检索
计算机视觉与模式识别
2025-01-28 v1 人工智能
多媒体
摘要
视频监控系统是确保智慧城市公共安全和管理的关键组件。作为视频监控中的基础任务,文本到图像人物检索旨在从图像图库中检索出与给定文本描述最匹配的目标人物。大多数现有的文本到图像人物检索方法是以监督方式训练的,需要目标域中充足的标记数据。然而,由于数据标注的困难和成本,在实际应用中只有目标域中未标记的数据,这限制了现有方法在实际场景中的泛化能力。为此,我们提出了一种新颖的无监督域适应方法,称为图基跨域知识蒸馏(GCKD),用于在跨数据集场景中学习文本到图像人物检索的跨模态特征表示。 proposed GCKD 方法包含两个主要组件。首先,设计了基于图的多模态传播模块,以建立视觉和文本样本之间的跨域关联。其次,提出了对比动量知识蒸馏模块,以利用在线知识蒸馏策略学习跨模态特征表示。通过联合优化这两个模块,所提出的方法能够高效地实现跨数据集文本到图像人物检索。 在三个公开可用的文本到图像人物检索数据集上进行大量实验表明,所提出的 GCKD 方法有效且 consistently优于最新的基线方法。
引用
@article{arxiv.2501.15052,
title = {Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval},
author = {Bingjun Luo and Jinpeng Wang and Wang Zewen and Junjie Zhu and Xibin Zhao},
journal= {arXiv preprint arXiv:2501.15052},
year = {2025}
}
备注
Accepted by AAAI 2025