WiFi2Cap:基于 Wi-Fi CSI 经肢体级语义对齐的语义动作描述生成
计算机视觉与模式识别
2026-03-25 v1 人工智能
摘要
面向室内感知的隐私保护语义人体活动理解至关重要,但现有基于 Wi-Fi CSI 的系统主要聚焦于姿态估计或预定义动作分类,而非细粒度语言生成。将 CSI 映射到自然语言描述面临语义鸿沟(无线信号与语言之间)以及左右/镜像歧义等方向敏感性问题。我们提出 WiFi2Cap,一个用于从 Wi-Fi CSI 生成动作描述的三阶段框架。视觉-语言教师从同步的视频-文本对中学习可迁移的监督信号,CSI 学生被对齐到教师的视觉空间和文本嵌入中。为提升方向敏感的描述生成,我们引入镜像一致性损失,在跨模态对齐期间减少镜像动作和左右歧义。随后,一个前缀调优语言模型从 CSI 嵌入生成动作描述。我们还引入了 WiFi2Cap 数据集,是一个用于从无线信号进行语义描述生成的同步 CSI-RGB-句子基准数据集。实验结果表明,WiFi2Cap 在 BLEU-4、METEOR、ROUGE-L、CIDEr 和 SPICE 指标上 consistently 优于基线方法,证明了有效的隐私友好型语义感知能力。
引用
@article{arxiv.2603.22690,
title = {WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment},
author = {Tzu-Ti Wei and Chu-Yu Huang and Yu-Chee Tseng and Jen-Jee Chen},
journal= {arXiv preprint arXiv:2603.22690},
year = {2026}
}
备注
6 pages, 4 figures