InterPartAbility:面向可解释人类重识别的文本引导零件匹配
计算机视觉与模式识别
2026-05-01 v1
摘要
文本到图像的人类重识别(TI-ReID)依赖自然语言文本描述从大型图像图库中检索最匹配的个体。虽然近期的大型视觉语言模型(VLM)实现了强大的检索性能,但其决策仍 largely不可解释。现有TI-ReID的可解释性方法仅依赖于slot注意力来突出关注的区域,但无法可靠地将视觉区域绑定到语义上有意义的概念上,这限制了解释仅为受限词汇上的定性可视化。本文引入InterPartAbility,一种可解释的TI-ReID方法,实现显式的零件级匹配并支持短语-区域对齐。提出一种新型开放词汇、轻量级监督的patch-phrase互动模块(PPIM),用于在概念层面的指导下训练标准TI-ReID模型。概念性零件短语为模型关注相应图像区域提供证据。InterPartAbility进一步约束CLIP ViT自注意力机制,使每个零件级别短语的patch激活在空间上集中,从而产生对齐的解释图。为TI-ReID引入定量可解释性协议,通过适应扰动基准评估指标,包括反事实区域遮蔽以衡量当顶部排名解释区域被移除时的检索性能下降。在挑战性基准(如CUHK-PEDES和ICFG-PEDES)上的实验结果显示,InterPartAbility在这些指标下实现了在可解释性方面的最先进(SOTA)性能,同时保持竞争的检索准确率。
引用
@article{arxiv.2604.27122,
title = {InterPartAbility: Text-Guided Part Matching for Interpretable Person Re-Identification},
author = {Shakeeb Murtaza and Aryan Shukla and Rajarshi Bhattacharya and Maguelonne Heritier and Eric Granger},
journal= {arXiv preprint arXiv:2604.27122},
year = {2026}
}