为何不问一个,当可以问 $k$ 个?面向 Top-$k$ 专家的学习型延迟
机器学习
2026-05-29 v6 机器学习
摘要
现有的学习型延迟 (Learning-to-Defer, L2D) 框架仅限于单专家延迟,迫使每个查询仅依赖一个专家,无法发挥群体专家的综合效应。我们提出首个面向 Top- 学习型延迟框架,使查询分配给成本最有效的 个实体。我们的表述统一了且严格推广了包括单阶段和双阶段模式、选择性预测以及经典级联等先前方法。特别是,它将常规的 Top-1 延迟规则恢复为特殊情形,同时在 时实现对多个专家的原则化协作。我们进一步提出 Top- 学习型延迟,即一种基于输入难度、专家质量和咨询成本学习最优专家数量的自适应变体。为实现实际学习,我们开发了一种新型代理损失函数,其在贝叶斯一致性、单阶段设置下的 一致性以及双阶段设置下的 一致性皆达成。关键在于,该代理损失独立于 ,允许一次性学习的政策可灵活部署于不同 值。实验在两种模式下均表明,Top- 和 Top- 在准确率与成本之间达成优越的权衡,开启了 L2D 中多专家延迟的新方向。
引用
@article{arxiv.2504.12988,
title = {Why Ask One When You Can Ask $k$? Learning-to-Defer to the Top-$k$ Experts},
author = {Yannis Montreuil and Axel Carlier and Lai Xing Ng and Wei Tsang Ooi},
journal= {arXiv preprint arXiv:2504.12988},
year = {2026}
}