先思后匹:一种面向通用行人重识别的强化推理范式
计算机视觉与模式识别
2026-04-22 v1
摘要
学习具有多场景泛化能力的身份判别性表征已成为行人重识别(ReID)的关键目标。然而,主流感知驱动范式倾向于从海量标注数据中学习拟合,而非理解身份因果线索,这导致在面对多种干扰时表征脆弱。在这项工作中,我们提出了ReID-R,一种新颖的推理驱动范式,通过将思维链(CoT)引入ReID流程来实现显式的身份理解和推理。具体来说,ReID-R包含两个阶段的贡献:(i)判别性推理预热,其中模型以无CoT标签的方式训练,以获得身份感知的特征理解;(ii)高效强化学习,它提出了一种非平凡的采样方法来构建场景可泛化的数据。在此基础上,ReID-R利用高质量奖励信号引导模型关注与身份相关的线索,实现精确推理和正确响应。在多个ReID基准上的大量实验表明,ReID-R仅使用14.3K非平凡数据(现有数据规模的20.9%)即可达到与优越方法相竞争的身份判别能力。此外,得益于其固有的推理能力,ReID-R可以为结果提供高质量的解释。
引用
@article{arxiv.2604.19218,
title = {Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification},
author = {Quan Zhang and Jingze Wu and Jialong Wang and Xiaohua Xie and Jianhuang Lai and Hongbo Chen},
journal= {arXiv preprint arXiv:2604.19218},
year = {2026}
}
备注
10 pages