中文

在线混合专家:最优集体决策的无忧学习

机器学习 2025-11-18 v2 人工智能

摘要

我们探讨了专家导向的 bandit 学习问题,称为在线混合专家(OMoE)。在这种设置下,给定上下文,候选专家小组必须确定如何聚合其输出以实现准确性的最优结果。我们提出了两个算法来解决该问题。第一个算法将聚合投票与 UCB 驱动的连续消除相结合,高效地剔除次优的探索动作。第二个算法采用在线加权多数投票机制,利用每个专家根据其预测能力所具有的投票权。我们在理想情况下推导了对 bandit 设置下 regret 属性的理论保证,并提供了相应的实证结果。作为现代应用研究,这些方法被用于在线微调一组专家大型语言模型(LLM),通过每一次响应后,生成式 LLM 动态重新加权其专家集合并/或选择最优的专家小组合成最准确的响应。我们的结果为结合多个专家以提高整体模型性能引入了新方法并提供了无忧保证。

关键词

引用

@article{arxiv.2510.21788,
  title  = {Online Mixture of Experts: No-Regret Learning for Optimal Collective Decision-Making},
  author = {Larkin Liu and Jalal Etesami},
  journal= {arXiv preprint arXiv:2510.21788},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025)