中文

RadarLLM:让大型语言模型理解来自毫米波点云序列的人类运动

机器学习 2025-11-18 v2

摘要

毫米波雷达提供了一种在低光、遮挡、雨雾等恶劣条件下实现的人类运动分析的隐私保护且环境稳健的替代方案。然而,其稀疏的点云对于语义理解构成重大挑战。我们提出了RadarLLM,首个利用大型语言模型(LLMs)进行雷达信号下人类运动理解的框架。RadarLLM 引入了两个关键创新:(1)基于我们提出的 Aggregate VQ-VAE 架构的运动引导雷达分词器,集成可变形人体模板和掩码轨迹建模,将空间-时间雷达序列转换为紧凑语义标记;(2)雷达感知语言模型,在共享嵌入空间中建立雷达与文本之间的跨模态对齐。为克服成对雷达-文本数据稀缺问题,我们构建了一个基于物理感知的合成管线,从运动-文本数据集生成逼真的雷达-文本数据集。在合成和真实世界基准上的大量实验表明,RadarLLM 实现了最先进的性能,使其在隐私和可见性约束下,甚至在恶劣环境中,能够实现稳健且可解释的运动理解。本论文已被接受于 AAAI 2026。本文为补充材料的扩展版本。

关键词

引用

@article{arxiv.2504.09862,
  title  = {RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence},
  author = {Zengyuan Lai and Jiarui Yang and Songpengcheng Xia and Lizhou Lin and Lan Sun and Renwen Wang and Jianran Liu and Qi Wu and Ling Pei},
  journal= {arXiv preprint arXiv:2504.09862},
  year   = {2025}
}

备注

Accepted by AAAI 2026 (extended version with supplementary materials)