模态链:从静态融合到 Omni-MLLM 中的动态编排
计算机视觉与模式识别
2026-04-17 v1
摘要
全模态大语言模型(Omni-MLLMs)承诺实现多样感知流的统一集成。然而,近期评估揭示了一个关键性能悖论:单模态基线模型在联合多模态推理时常常优于当前模型。我们追溯这种感知脆弱性至当前模型普遍采用的静态融合拓扑,识别出两种结构病理:序列输入中的位置偏置和交错格式中的对齐陷阱,这两种病理无论基于什么任务语义,都系统性地扭曲注意力机制。为解决这种功能刚性问题,我们提出了模态链(Chain of Modality, CoM),一个智能体框架,将多模态融合从被动拼接转向动态编排。CoM 可适应性地编排输入拓扑,在平行、顺序和交错路径之间切换,以中和结构偏置。此外,CoM 将认知执行分为两个与任务对齐的路径:针对直接感知的简化的“直接决定”路径,以及针对分析审计的结构化的“推理决定”路径。在训练自由或数据高效 SFT 设置下,CoM 在多样化基准上实现了稳健且一致的泛化。
引用
@article{arxiv.2604.14520,
title = {Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs},
author = {Ziyang Luo and Nian Liu and Junwei Han},
journal= {arXiv preprint arXiv:2604.14520},
year = {2026}
}