T2I-VeRW:用于文本到图像车辆检索的部件级精细感知
计算机视觉与模式识别
2026-05-08 v1 人工智能
摘要
车辆重识别 (Re-ID) 旨在从由非重叠摄像机捕获的图像中检索与给定查询最相似的图像。将车辆 Re-ID 从仅限图像查询扩展到基于文本的查询,使能够在仅有目标车辆目击描述可用的实际场景中进行检索。在本文中,我们提出PFCVR,即一种用于文本到图像车辆重识别的部件级精细跨模态车辆检索模型。PFCVR 在部件级别构建局部配对图像和文本,引入可学习的部件查询标记,在对齐视觉部件特征之前聚合部件特定和完整句子上下文。在这一显式局部对齐之上,双向掩码恢复模块让每个模态在其他模态的指导下重建其被遮盖内容,从而在隐式地将局部对应关系导入全局特征对齐。此外,我们构建了一个新的大规模数据集,称为T2I-VeRW,其中包含 14,668 张图片覆盖 1,796 个车辆身份,带有部件级注释。在T2I-VeRI 数据集上的实验结果表明,PFCVR 实现了 29.2% 的 Rank-1 准确率,优于最佳竞争方法提升了 3.7 个百分点。在新提议的T2I-VeRW基准上,PFCVR 实现了 55.2% 的 Rank-1 准确率,超过了综合性的一组最新 SOTA 方法。源代码将在 https://github.com/Event-AHU/Neuromorphic_ReID 上发布。
引用
@article{arxiv.2605.06012,
title = {T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval},
author = {Xiao Wang and Ziwen Wang and Weizhe Kong and Wentao Wu and Yuehang Li and Aihua Zheng and Chenglong Li and Jin Tang},
journal= {arXiv preprint arXiv:2605.06012},
year = {2026}
}