面向 TBPS 的统一多数据集训练
计算机视觉与模式识别
2026-01-22 v1
摘要
基于文本的行人搜索(TBPS)借助视觉-语言模型(VLMs)取得了显著进展,但仍受限于有限的训练数据,且 VLMs 本质上并未针对以行人为中心的识别进行预训练。因此,现有的 TBPS 方法依赖于以数据集为中心的微调来应对分布偏移,导致针对不同数据集产生多个独立训练的模型。虽然合成数据可以增加微调 VLMs 所需的规模,但并不能消除特定于数据集的适配。这引出了一个基本问题:我们能否在多个数据集上训练一个单一的统一 TBPS 模型?我们表明,在所有数据集上进行朴素的联合训练仍然是次优的,因为当前的训练范式无法扩展到大量唯一行人身份,并且容易受到噪声图文对的影响。为了应对这些挑战,我们提出了 Scale-TBPS 并做出了两项贡献:一种噪声感知的统一数据集整理策略,能够内聚地合并多样化的 TBPS 数据集;以及一个可扩展的判别性身份学习框架,在大量唯一身份下依然有效。在 CUHK-PEDES、ICFG-PEDES、RSTPReid、IIITD-20K 和 UFine6926 上的大量实验表明,单一的 Scale-TBPS 模型优于以数据集为中心优化的模型和朴素联合训练。
引用
@article{arxiv.2601.14978,
title = {Unified Multi-Dataset Training for TBPS},
author = {Nilanjana Chatterjee and Sidharatha Garg and A V Subramanyam and Brejesh Lall},
journal= {arXiv preprint arXiv:2601.14978},
year = {2026}
}