能力指令微调:动态 LLM 路由的新范式
计算与语言
2025-02-25 v1 人工智能
机器学习
摘要
大型语言模型(LLM)已展现出类似人类的指令遵循能力,尤其是参数量超过千亿的那些模型。一些更小、资源友好的 LLM 的组合能力可以处理大 LLM 擅长的大多数指令。在本工作中,我们探讨如何为每条指令路由表现最佳的 LLM,以实现更好的整体性能。我们开发了一种新范式,通过构建包含模型能力表示、用户指令和性能查询提示的能力指令来评估性能。为了从能力指令中学习,我们引入了一种名为带能力测试的模型选择(Model-SAT)的端到端框架,该框架根据不同模型擅长或难以处理的任务生成正负样本。Model-SAT 使用一个模型能力编码器,将其模型表示扩展到一个轻量级 LLM。我们的实验表明,Model-SAT 能够理解候选模型的性能维度,并提供其处理各种指令能力的概率。此外,在部署期间,新模型可以快速推断其在 50 个任务(每个任务 20 个样本)上的能力测试结果。Model-SAT 无需候选推理即可执行 SOTA 模型路由,并适用于真实世界中新模型发布的场景。代码可在 https://github.com/Now-Join-Us/CIT-LLM-Routing 获取
引用
@article{arxiv.2502.17282,
title = {Capability Instruction Tuning: A New Paradigm for Dynamic LLM Routing},
author = {Yi-Kai Zhang and De-Chuan Zhan and Han-Jia Ye},
journal= {arXiv preprint arXiv:2502.17282},
year = {2025}
}
备注
AAAI 2025; Project Page: https://cit-llm-routing.github.io