中文

Babel:面向多模态感知的可扩展模态对齐预训练模型

人工智能 2025-03-24 v2 计算机视觉与模式识别 机器学习 信号处理

摘要

本文提出了Babel,即可扩展模态对齐模型,专为多模态感知设计。尽管已有大量工作致力于多模态对齐,但由于数据稀缺限制,这些方法难以有效地集成多种感知模态。如何利用部分配对的多模态数据 remains 一个未解决的挑战。Babel 通过引入可扩展模态对齐概念来应对这一挑战。其核心思想是将N模态对齐转化为一系列二模态对齐。还提出了若干新技术进一步缓解数据稀缺问题,并在可扩展对齐过程中平衡新引入模态与先前建立模态对齐的贡献。我们提供了完整的实现。在预训练阶段,Babel 当前对齐了6种感知模态,包括Wi-Fi、毫米波、惯性测量单元(IMU)、激光雷达(LiDAR)、视频和深度数据。在部署阶段,作为基础模型,Babel 允许从中选择任何单个或组合后的模态,并可用于下游任务。评估表明,Babel 在八个人类动作识别数据集上表现优异,优于广泛的基线方法,如最先进的单模态感知网络、多模态感知框架和多模态大语言模型。Babel 不仅提升了单个模态感知性能(平均准确率提升12%),还能有效融合多个可用模态(准确率提升最高达22%)。案例研究还揭示了Babel 赋能的新兴应用场景,包括跨模态检索(即感知成像)以及连接大语言模型以实现感知理解。

关键词

引用

@article{arxiv.2407.17777,
  title  = {Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment},
  author = {Shenghong Dai and Shiqi Jiang and Yifan Yang and Ting Cao and Mo Li and Suman Banerjee and Lili Qiu},
  journal= {arXiv preprint arXiv:2407.17777},
  year   = {2025}
}

备注

Accepted by SenSys'25