Adapter-增强型多约束多模态推理调度中的 Bandits 方法
机器学习
2026-03-09 v1
摘要
多模态大语言模型(MLLM)推理调度可在实际且异构的预算下实现出色的响应质量,超越单一后端环境所能提供的效果。然而,在线 MLLM 任务调度并非易事,因为请求在模态组成和潜在推理难度方面差异巨大,而执行后端由于系统抖动和网络波动而面临不同的、时变的成本。这些耦合的不确定性带来了两个核心挑战:派生语义忠实且调度相关的多模态任务表示,以及在不可逆的多维预算下进行低开销的在线决策。为此,我们提出了 \emph{M-CMAB} (\underline{M}ulti-modal \underline{M}ulti-constraint \underline{C}ontextual \underline{M}ulti-\underline{A}rmed \underline{B}andit),一个集成 adapter 的 MLLM 推理调度框架,包含三个组件:(i) 一个 CLS 注意力式、冻结主干的 \emph{Predictor},用于提取紧凑的任务表示并仅更新针对具体动作的轻量级 adapter; (ii) 一个原始-对偶 \emph{Constrainer},用于维护在线拉格朗日乘子以通过每轮目标实现长期约束; (iii) 一个双阶段 \emph{Scheduler},在不可逆预算下平衡探索与开发。我们在多维背包约束下建立了 regret 保证。在由异构后端构成的复合多模态基准测试中,\emph{M-CMAB} 在各种预算 regime 下均一致优于 state-of-the-art 基线,实现最高可达 14.18% 的提升,并紧随由 oracle 提供的上界。代码已公开于 https://anonymous.4open.science/r/M2CMAB/。
引用
@article{arxiv.2603.06403,
title = {Adapter-Augmented Bandits for Online Multi-Constrained Multi-Modal Inference Scheduling},
author = {Xianzhi Zhang and Yue Xu and Yinlin Zhu and Di Wu and Yipeng Zhou and Miao Hu and Guocong Quan},
journal= {arXiv preprint arXiv:2603.06403},
year = {2026}
}