中文

TVPR:文本到视频行人检索及一个新基准

计算机视觉与模式识别 2025-04-22 v3

摘要

现有大多数基于文本的行人检索方法都聚焦于文本到图像行人检索。然而,由于孤立帧缺乏动态信息,当行人被遮挡或孤立帧中缺失可变运动细节时,性能会受到制约。为克服这一问题,我们提出了一种新颖的文本到视频行人检索(TVPR)任务。由于目前没有用自然语言描述行人视频的数据集或基准,我们构建了一个包含详细自然语言标注的大规模跨模态行人视频数据集,称为文本到视频行人重识别(TVPReid)数据集。本文中,我们引入了一种多元素特征引导片段学习(MFGF)策略,该策略利用跨模态文本-视频表示提供强文本-视觉与文本-运动匹配信息,以应对不确定的遮挡冲突与可变运动细节。具体而言,我们建立了两个潜在的跨模态空间用于文本与视频特征的协同学习,以逐步缩小文本与视频之间的语义差异。为评估所提 MFGF 的有效性,我们在 TVPReid 数据集上进行了大量实验。据我们所知,MFGF 是首个将视频用于基于文本的行人检索任务的成功尝试,并在 TVPReid 数据集上取得了最先进的性能。TVPReid 数据集将公开可用,以惠及未来研究。

关键词

引用

@article{arxiv.2307.07184,
  title  = {TVPR: Text-to-Video Person Retrieval and a New Benchmark},
  author = {Xu Zhang and Fan Ni and Guan-Nan Dong and Aichun Zhu and Jianhui Wu and Mingcheng Ni and Hui Liu},
  journal= {arXiv preprint arXiv:2307.07184},
  year   = {2025}
}

备注

9 pages, 8 figures, Proceedings of the 32nd ACM International Conference on Multimedia