无线多模态基础模型 (WMFM):面向 6G ISAC 系统的视觉与通信模态集成
网络与互联网体系结构
2026-01-01 v1
摘要
多模态基础模型的出现通过实现跨不同数据类型的联合理解,彻底改变了学习范式。在下一代无线网络的背景下,集成感知与通信模态为开发可泛化且数据高效的模型提供了独特机遇。在本工作中,我们引入了基于对比学习的无线多模态基础模型 (WMFM),这是一个从无线信道系数和视觉图像中联合学习的大规模框架。WMFM 使用对比学习(一种自监督学习技术)进行预训练,该技术无需显式标签即可对齐相机数据与信道数据的嵌入。预训练的编码器随后被冻结并用作特征提取器,配合轻量级的任务特定头,针对用户定位和视距/非视距分类等下游任务进行微调。在 DeepVerse6G 数据集上的大量实验表明,与端到端 (E2E) 基准相比,所提出的 WMFM 在 LoS/nLoS 分类上的平衡准确率提高了 17%,定位误差降低了 48.5%,同时训练时间最多减少了 90 倍。即使仅使用 20% 的数据进行训练,基于 WMFM 的头也优于全监督的 E2E 模型,凸显了其鲁棒性和数据高效的学习能力。所提出的方法为集成感知与通信 (ISAC) 系统中的可扩展多模态学习奠定了基础,为智能且自适应的 6G 网络铺平了道路。
引用
@article{arxiv.2512.23897,
title = {Wireless Multimodal Foundation Model (WMFM): Integrating Vision and Communication Modalities for 6G ISAC Systems},
author = {Mohammad Farzanullah and Han Zhang and Akram Bin Sediq and Ali Afana and Melike Erol-Kantarci},
journal= {arXiv preprint arXiv:2512.23897},
year = {2026}
}
备注
Journal Paper, 13 pages, 11 figures, 4 tables