基于大模型感知的语义蒸馏与对齐的 WiFi 手势识别泛化化
计算机视觉与模式识别
2026-01-27 v1
摘要
WiFi 基于手势识别已成为 AIoT 环境中非接触式和隐私保护人机交互的有前景的射频感知范例。然而,现有方法常因信道状态信息(Channel State Information, CSI)的领域敏感性以及缺乏高层次手势抽象而受限于泛化性和语义表达性。为此,我们提出一种新颖的泛化框架,称为大模型感知语义蒸馏与对齐(Large-Model-Aware Semantic Distillation and Alignment, GLSDA),该框架利用预训练大型基础模型的语义先验来增强单域和跨域情境下的手势表征学习。具体而言,我们首先设计双路径 CSI 编码管道,通过 CSI 比率相位序列和 Doppler 频谱图捕获几何和动态手势模式。这些表征随后输入到多尺度语义编码器中,通过跨模态注意力机制学习鲁棒的时序嵌入并与手势语义对齐。为进一步增强类别判别,我们引入语义感知软监督方案,对编码类间相关性进行建模,减少语义相似手势的标签模糊性。最后,我们开发了稳健双向蒸馏策略,将对齐后的模型压缩到轻量级学生网络,同时从教师模型中联合蒸馏中间特征和语义信息软标签。广泛的 Widar3.0 基准实验表明,GLSDA 在单域和跨域手势识别任务中 consistently 优于最先进的方法,同时显著降低模型规模和推理延迟。该方法为真实 AIoT 应用中的通用射频手势界面提供了可扩展且可部署的解决方案。
引用
@article{arxiv.2510.13390,
title = {Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment},
author = {Feng-Qi Cui and Yu-Tong Guo and Tianyue Zheng and Jinyang Huang},
journal= {arXiv preprint arXiv:2510.13390},
year = {2026}
}
备注
Accepted by IEEE ICPADS 2025