HoloLLM: 用于语言驱动人体感知与推理的多模态基础模型
计算机视觉与模式识别
2026-02-25 v2 人工智能
计算与语言
机器学习
多媒体
摘要
在智能家居中运行的具身智能体必须通过多种感官输入理解人类行为,并通过自然语言进行交流。虽然视觉-语言模型(VLMs)已实现了令人印象深刻的语言驱动感知,但它们对视觉数据的依赖限制了在不包含遮挡、光线不足或隐私约束等真实场景中的鲁棒性。在本文中,我们提出了HoloLLM,一种多模态大语言模型(MLLM),它整合了不常见但强大的感知模态,如LiDAR、红外、毫米波雷达和WiFi,以在异构环境中实现无缝的人体感知与推理。我们解决了两个关键挑战:(1)罕见传感器的对齐模态-文本数据稀缺,以及(2)它们物理信号表示的异构性。为克服这些问题,我们设计了一种通用模态注入投影器(UMIP),通过粗到细的交叉注意力,在不引入显著对齐开销的情况下增强预对齐的模态嵌入。我们进一步引入了一种人机VLM协作的数据整理流水线,为感知数据集生成配对的文本注释。在两个新构建的基准数据集上的大量实验表明,HoloLLM显著优于现有的MLLM,将语言驱动的人体感知准确率提升了最多30%。这项工作为真实世界的语言感知多模态具身智能奠定了新的基础。
引用
@article{arxiv.2505.17645,
title = {HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning},
author = {Chuhao Zhou and Jianfei Yang},
journal= {arXiv preprint arXiv:2505.17645},
year = {2026}
}
备注
Camera-ready version. Accepted at NeurIPS 2025