中文

跨越时空与视角:面向鲁棒视频人体重识别的多时序跨视图学习

计算机视觉与模式识别 2025-11-05 v1

摘要

跨视图域中的视频人体重识别(例如,空中-地面监视)仍是开放问题,因为存在极端视角变化、尺度差异和时序不一致性。为解决这些挑战,我们提出了 MTF-CVReID,一个在 ViT-B/16 主干上引入七个互补模块的参数高效框架。具体包括:(1)跨流特征归一化(CSFN)以纠正摄像机和视角偏差;(2)多分辨率特征调谐(MRFH)用于跨海拔尺度稳定;(3)身份感知记忆模块(IAMM)以强化持久身份特征;(4)时序动力学建模(TDM)用于运动感知的短期时序编码;(5)跨视图特征对齐(IVFA)用于视角不变表示对齐;(6)层次时序模式学习(HTPL)以捕获多尺度时序规律;(7)多视图身份一致性学习(MVICL)使用对比学习范式强制跨视图身份连贯性。尽管仅在基线上增加约 200 万参数和 0.7 GFLOPs,MTF-CVReID 保持了实时效率(189 FPS),并在 AG-VPReID 数据集上实现了所有海拔水平的准确性能,同时对 G2A-VReID 和 MARS 数据集表现出强大的跨数据集泛化。这些结果表明, carefully 设计的适配器模块可以在不牺牲计算效率的前提下显著增强跨视图鲁棒性和时序一致性。源代码可在 https://github.com/MdRashidunnabi/MTF-CVReID 提供。

关键词

引用

@article{arxiv.2511.02564,
  title  = {Seeing Across Time and Views: Multi-Temporal Cross-View Learning for Robust Video Person Re-Identification},
  author = {Md Rashidunnabi and Kailash A. Hambarde and Vasco Lopes and Joao C. Neves and Hugo Proenca},
  journal= {arXiv preprint arXiv:2511.02564},
  year   = {2025}
}