中文

CAST:基于伪影雷达的通道感知空间迁移学习用于手势识别

计算机视觉与模式识别 2026-05-12 v1

摘要

我们提出 CAST,一种双流体系结构,利用通道感知空间迁移学习用于孤立手势识别,解决 60 GHz 雷达幅度唯一 Range-Time Maps (RTM) 的挑战。该框架将结合三个物理感知体系结构与预训练视觉主干网络,均在雷达唯一约束下运行,适用于临床和字母手势。首先,将显式分贝转线性反演结合加窗快速傅里叶变换,以提取 Cadence Velocity Diagrams (CVD),同时避免对数压缩信号的谱分析中产生的谐波失真。其次,应用跨天线空间注意力模块对原始天线通道施加注意力,进行卷积前处理,保留接收天线之间的振幅协方差。第三,采用非对称跨注意力机制融合来自并行 ConvNeXt-Tiny (CVD) 和 EfficientNetV2-S (RTM) 主干网络的表示。广泛的实验结果表明,该体系结构在 5 折交叉验证下实现了 80.5% 的 Top-1 准确率,较最佳单模型基线 (77.2%) 提升了 3.3%。这些发现表明,物理感知信号表示为受限传感器模态下的雷达唯一手势识别提供了有前景的方向。源代码可在 https://github.com/Shakhoyat/CAST-at-SignEval2026 获取。

关键词

引用

@article{arxiv.2605.08663,
  title  = {CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition},
  author = {Md. Shakhoyat Rahman Shujon and Sheikh Md. Galib Mahim and Md. Milon Islam and Md Rezwanul Haque and Md Rabiul Islam and Hamdi Altaheri and Fakhri Karray},
  journal= {arXiv preprint arXiv:2605.08663},
  year   = {2026}
}

备注

Accepted for the Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), MSLR Workshop @ CVPR 2026 in Denver (Colorado, USA)