中文

基于多对多编码器/解码器范式的实时穿墙姿态成像

计算机视觉与模式识别 2019-10-22 v2 机器学习 机器学习

摘要

克服视觉屏障并发展“透视视觉”一直是人类长久以来的梦想。与可见光不同,射频(RF)信号可穿透不透明遮挡物并对人体产生强反射。本文建立一种深度学习模型,经训练后即便在视觉遮挡下也能重建 15 点人体骨架的连续视频。训练过程采用受费曼学习法启发的学生/教师学习流程:首先使用包含光学相机与 RF 天线阵列收发器的同址装置同步采集视频帧与 RF 数据;随后用基于计算机视觉的步态分析“教师”模块处理视频帧,生成每帧的真实人体骨架;接着用由残差卷积神经网络(CNN)、区域提议网络(RPN)和长短期记忆(LSTM)循环神经网络构成的“学生”深度学习模型从对应 RF 数据预测同类骨架,三者分别用于 1)从 RF 图像提取空间特征,2)检测场景中所有人物,3)在多个时间步上聚合信息。结果表明,该模型仅利用 RF 信号即可准确且完整地预测视觉遮挡后的人体姿态。主要学术贡献包括新颖的多对多成像方法、RPN 与 LSTM 网络的独特集成,以及原创的训练流程。

关键词

引用

@article{arxiv.1904.00739,
  title  = {Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm},
  author = {Kevin Meng and Yu Meng},
  journal= {arXiv preprint arXiv:1904.00739},
  year   = {2019}
}