Arch-Router:使LLM路由与人类偏好对齐
计算与语言
2025-06-23 v1
摘要
随着大语言模型(LLM)的快速激增——每个模型针对不同的优势、风格或延迟/成本配置进行了优化——路由已成为操作化使用不同模型的关键技术。然而,现有的LLM路由方法在两个关键方面存在局限:它们使用通常无法捕捉由主观评估标准驱动的人类偏好的基准来评估性能,并且它们通常从有限的模型池中进行选择。在这项工作中,我们提出了一种偏好对齐的路由框架,该框架通过将查询匹配到用户定义的领域(例如,旅行)或动作类型(例如,图像编辑)来指导模型选择——提供了一种在路由决策中编码偏好的实用机制。具体来说,我们引入了\textbf{Arch-Router},一个紧凑的1.5B模型,它学习将查询映射到领域-动作偏好以进行模型路由决策。我们的方法还支持无缝添加新模型进行路由,而无需重新训练或修改架构。在对话数据集上的实验表明,我们的方法在将查询与人类偏好匹配方面达到了最先进的(SOTA)结果,优于顶级专有模型。我们的方法捕捉了主观评估标准,并使路由决策更加透明和灵活。我们的模型可在以下网址获取:\texttt{https://huggingface.co/katanemo/Arch-Router-1.5B}。
引用
@article{arxiv.2506.16655,
title = {Arch-Router: Aligning LLM Routing with Human Preferences},
author = {Co Tran and Salman Paracha and Adil Hafeez and Shuguang Chen},
journal= {arXiv preprint arXiv:2506.16655},
year = {2025}
}