LLMCount:利用多模态大语言模型增强静止人体毫米波检测
计算机视觉与模式识别
2024-11-12 v2
摘要
毫米波感知以非侵入性和隐私保护的方式为人们提供了感知周围人群的能力,具有巨大的应用潜力。然而,由于微小动作(如呼吸或偶然的微动)等几个因素,检测静止人群仍具挑战性,这些动作在数据收集过程中极易被视为噪声簇,并在后续处理中被滤除。此外,由信号功率衰减以及外部反射体或吸收体引起的干扰所导致的信号功率分布不均,进一步使精确检测复杂化。为了应对这些挑战并实现跨不同应用场景(需专门的领域适应)的静止人群检测,我们引入了 LLMCount,这是首个利用大语言模型(LLM)能力以增强人群检测性能的系统。通过利用 LLM 的决策能力,我们能够成功补偿信号功率以获得均匀分布,从而实现更高精度的检测。为了评估系统性能,我们在大厅、会议室和电影院等多样化场景下进行了全面评估。评估结果表明,与先前方法相比,我们提出的方法达到了高检测精度且总体延迟更低。
引用
@article{arxiv.2409.16209,
title = {LLMCount: Enhancing Stationary mmWave Detection with Multimodal-LLM},
author = {Boyan Li and Shengyi Ding and Deen Ma and Yixuan Wu and Hongjie Liao and Kaiyuan Hu},
journal= {arXiv preprint arXiv:2409.16209},
year = {2024}
}