中文

OrdMoE:通过多模态混合专家大语言模型中的分层专家组排序实现偏好对齐

机器学习 2025-11-25 v1 人工智能

摘要

偏好学习最近已成为多模态大语言模型(MLLM)训练后对齐的关键策略。然而,现有方法主要依赖外部人工标注的偏好数据,收集成本高且耗时。在本工作中,我们提出了 OrdMoE,一种新颖的偏好对齐框架,完全绕过对外部人工偏好的依赖,而是利用混合专家(MoE)架构中的内在信号。具体而言,我们观察到路由器的专家选择分数隐式地编码了对响应质量的排序(即得分更高的专家始终生成更高质量的输出)。基于这一洞察,OrdMoE 通过根据每个 token 的路由分数将专家分组为有序层级,并分别激活每个层级来生成质量递增的响应序列,从而构建了内部偏好层次结构。这产生了对生成响应的零成本、自监督偏好排序,可以直接使用标准偏好学习目标进行优化。在多个多模态基准上的广泛实验表明,OrdMoE 显著增强了多模态混合专家大语言模型的对齐性和整体性能,在无需任何人工标注偏好数据的情况下取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2511.19023,
  title  = {OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs},
  author = {Yuting Gao and Weihao Chen and Lan Wang and Ruihan Xu and Qingpei Guo},
  journal= {arXiv preprint arXiv:2511.19023},
  year   = {2025}
}