中文

基于对抗反馈的 LLM 路由

机器学习 2025-10-02 v1

摘要

我们研究了 LLM 路由问题,即为每个查询选择最佳模型,同时在用户满意度、模型专业性和推理成本之间进行权衡。我们将路由建模为情境对抗 bandits,通过来自两两偏好反馈而非绝对评分的学习,从而实现标签高效和动态适应。基于此建模,我们引入了类别校准微调(Category-Calibrated Fine-Tuning, CCFT),这是一种从离线数据中使用带类别加权的对比微调派生模型嵌入的表示学习方法。这些嵌入使我们能够在情境对抗 bandits 上实现感觉良好 Thompson 采样(Feel-Good Thompson Sampling for Contextual Dueling Bandits, FGTS.CDB),这是一种在理论上得到良好依托的后验抽样算法。我们提出了四种类别加权方案,显式集成模型质量和成本,并在 RouterBench 和 MixInstruct 数据集上对所提方法进行了实证评估。在两个基准测试中,我们的方法在累积遗憾更低、收敛更快,同时在鲁棒性和性能-成本平衡方面优于构建于通用 OpenAI 嵌入模型的强大基线。

关键词

引用

@article{arxiv.2510.00841,
  title  = {LLM Routing with Dueling Feedback},
  author = {Chao-Kai Chiang and Takashi Ishida and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2510.00841},
  year   = {2025}
}