中文

长距离条件下语义感知的多模态步态识别

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

步态识别是一种新兴的生物识别技术,可实现非侵入且难以伪造的人类识别。然而,大多数现有方法局限于短距离、单模态环境,难以在真实世界条件下泛化到长距离和跨距离情景。为填补这一差距,我们提出LRGait——首个为稳健的长距离步态识别而设计的LiDAR-摄像机多模态基准测试,覆盖多样化的户外距离和环境。我们进一步提出EMGaitNet——一个专为长距离多模态步态识别所设计的端到端框架。为弥合RGB图像与点云之间的模态差异,我们引入语义引导的融合管道。CLIP-based语义挖掘(SeMi)模块首先提取人体部位感知的语义线索,然后用于在统一嵌入空间中通过语义引导对齐(SGA)模块对齐2D和3D特征。对称交叉注意力融合(SCAF)模块层次性地整合视觉轮廓和3D几何特征,时空(ST)模块捕获全局步态动力学。广泛的实验在各种步态数据集上验证了该方法的有效性。

关键词

引用

@article{arxiv.2603.14189,
  title  = {Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions},
  author = {Zhiyang Lu and Wen Jiang and Tianren Wu and Zhichao Wang and Changwang Zhang and Siqi Shen and Ming Cheng},
  journal= {arXiv preprint arXiv:2603.14189},
  year   = {2026}
}

备注

Accepted by AAAI 2026