中文

利用大语言模型进行多模态传感器后期融合以实现活动识别

机器学习 2025-12-23 v3

摘要

传感器数据流为下游应用提供了关于活动和情境的宝贵信息,但整合互补信息可能具有挑战性。我们展示了可以利用大语言模型(LLMs)对来自音频和运动时间序列数据的活动分类进行后期融合。我们从Ego4D数据集中整理了一个用于跨情境(例如,家务活动、体育运动)多样化活动识别的数据子集。评估的LLMs在没有特定任务训练的情况下,实现了12类零样本和单样本分类F1分数,显著高于随机水平。通过基于LLM的融合,将来自模态特定模型的零样本分类,可以在对齐训练数据有限的情况下,实现多模态时序应用,而无需学习共享嵌入空间。此外,基于LLM的融合可以在不需要为目标应用特定的多模态模型增加额外内存和计算的情况下进行模型部署。

关键词

引用

@article{arxiv.2509.10729,
  title  = {Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition},
  author = {Ilker Demirel and Karan Thakkar and Benjamin Elizalde and Miquel Espi Marques and Aditya Sarathy and Yang Bai and Umamahesh Srinivas and Jiajie Xu and Shirley Ren and Jaya Narain},
  journal= {arXiv preprint arXiv:2509.10729},
  year   = {2025}
}

备注

NeurIPS Workshop on Learning from Time Series for Health