中文

M3LLM:面向网络环境中多模态大语言模型的模型上下文协议驱动的视觉专家混合模型

网络与互联网体系结构 2025-08-05 v1

摘要

当前的多模态大语言模型(MLLMs)依赖集中式架构,常因输入任务与其固定视觉编码模块之间的对齐性差,限制了其在多样化和动态视觉任务上的性能。随着资源高效模型在无线网络边缘设备上的部署日益增多,动态利用分布式视觉专家以提升 MLLM 推理质量的机会随之而来。为实现此目标,我们提出了 M3LLM,通过模型上下文协议(MCP)协调视觉专家混合,以实现分布式 MLLM。具体而言,MCP 是一种开放协议,将输入任务上下文结构化为可解释的表征,使中央模型主干与边缘托管的视觉专家之间实现无线网络感知的协调。基于 MCP 表征,M3LLM 将视觉专家路由建模为一个在任务-专家语义兼容性与信道性能之间进行联合优化的优化问题。为解决由此产生的梯度冲突,我们开发了基于解耦奖励信号的双流 Soft Actor-Critic(SAC)算法,并引入基于层次贝叶斯建模的自适应稳定性增强模块(ASEM),以确保有效的路由。实验表明,M3LLM 在动态无线网络条件下提高了任务准确性、降低了通信成本,并增强了专家路由的适应性。

关键词

引用

@article{arxiv.2508.01805,
  title  = {M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks},
  author = {Yongjie Zeng and Hongyang Du},
  journal= {arXiv preprint arXiv:2508.01805},
  year   = {2025}
}