G3R:从 2D 视频生成丰富且细粒度的毫米波雷达数据以实现泛化手势识别
多媒体
2024-04-24 v1 计算机视觉与模式识别
人机交互
摘要
毫米波雷达作为一种有望实现普适且保护隐私的手势识别的模态,近期正日益受到关注。然而,缺乏丰富且细粒度的雷达数据集阻碍了开发能够跨各种用户姿势(如站立、坐着)、位置和场景进行泛化的深度学习手势识别模型。为解决这一问题,我们求助于设计一种软件流水线,利用丰富的 2D 视频生成逼真的雷达数据,但这需要解决模拟用户手势多样且细粒度反射特性的挑战。为此,我们设计了包含三个关键组件的 G3R:(i) 手势反射点生成器将手臂骨架点扩展以形成人体反射点;(ii) 信号仿真模型模拟雷达信号的多径反射和衰减,以输出人体强度图;(iii) 编码器-解码器模型结合采样模块和拟合模块,解决生成雷达数据与真实雷达数据之间点数量和分布的差异,从而生成逼真的雷达数据。我们使用来自公开数据源的 2D 视频和自行收集的真实雷达数据实现并评估了 G3R,证明了其在手势识别方面优于其他 SOTA 方法。
引用
@article{arxiv.2404.14934,
title = {G3R: Generating Rich and Fine-grained mmWave Radar Data from 2D Videos for Generalized Gesture Recognition},
author = {Kaikai Deng and Dong Zhao and Wenxin Zheng and Yue Ling and Kangwen Yin and Huadong Ma},
journal= {arXiv preprint arXiv:2404.14934},
year = {2024}
}
备注
18 pages, 29 figures