极远距离视频人体重识别的尺度感知视觉语言适应
计算机视觉与模式识别
2026-04-07 v1
摘要
极远距离视频人体重识别(ReID)因尺度压缩、分辨率退化、运动模糊和空中-地面视角不匹配而尤其具有挑战性。随着相机高度和受体距离的增加,训练于近距离图像的模型会显著退化。本文研究如何适应大规模视觉语言模型以在这些条件下可靠运行。我们以基于CLIP的基线为起点,将视觉主干网络从ViT-B/16升级为ViT-L/14,并引入面向主干的选择性微调以稳定较大 transformer的适应。为解决噪声和低分辨率轨迹块的问题,我们包含一种轻量级时序注意力池化机制,以抑制退化帧并强调有信息的观察。我们保留基于适配器和提示条件的跨视图学习,以缓解空中-地面域迁移,并进一步通过改进的优化和k-递归重排序来提升检索。实验在DetReIDX压力测试基准上显示,我们的方法在A2G上实现46.69的mAP,在G2A上实现41.23的mAP,在A2A上实现22.98的mAP,总体mAP为35.73。这些结果表明,大规模视觉语言主干网络结合以稳定性为导向的适应,显著增强了在极远距离视频人体重识别中的鲁棒性。
引用
@article{arxiv.2604.04183,
title = {Scale-Aware Vision-Language Adaptation for Extreme Far-Distance Video Person Re-identification},
author = {Ashwat Rajbhandari and Bharatesh Chakravarthi},
journal= {arXiv preprint arXiv:2604.04183},
year = {2026}
}