中文

VST-Pose:基于速度集成的时空注意力网络用于人类WiFi姿态估计

计算机视觉与模式识别 2025-07-15 v1

摘要

WiFi人体姿态估计因其穿透性和隐私优势而成为一种有前景的非视觉方法。本文提出了VST-Pose,一种新型深度学习框架,用于基于WiFi信道状态信息进行精确连续姿态估计。该方法引入了ViSTA-Former,一种具有双流架构的时空注意力主干网络,采用双流架构分别捕获身体关节间的时序依赖性和结构关系。为增强对细微人体运动的敏感性,框架中集成了速度建模分支,该分支学习短期关键点位移模式,改进了细粒度运动表征。我们构建了一个专为智能家庭护理场景设计的2D姿态数据集,证明该方法在PCK@50指标上达到92.2%的准确率,相较于自采集数据集上现有方法在PCK@50指标上提升了8.3%。进一步在公开的MMFi数据集上进行评估,确认了该模型在3D姿态估计任务中的鲁棒性和有效性。该提出系统为室内环境中持续的人体运动分析提供了可靠且注重隐私的解决方案。我们的代码已发布在 https://github.com/CarmenQing/VST-Pose。

关键词

引用

@article{arxiv.2507.09672,
  title  = {VST-Pose: A Velocity-Integrated Spatiotem-poral Attention Network for Human WiFi Pose Estimation},
  author = {Xinyu Zhang and Zhonghao Ye and Jingwei Zhang and Xiang Tian and Zhisheng Liang and Shipeng Yu},
  journal= {arXiv preprint arXiv:2507.09672},
  year   = {2025}
}

备注

8 pages, 7 figures, 8 tables. WiFi CSI, VST-Pose framework + ViSTA-Former dual-stream attention backbone. Code: https://github.com/CarmenQing/VST-Pose