SATER:一种自我感知且高效率的路由与级联方法
分布式、并行与集群计算
2025-10-08 v1 人工智能
机器学习
摘要
大型语言模型(LLM)在各类任务中展现出惊人的性能,但其有效性往往取决于高成本的商业API或云服务。模型选择因此涉及性能与成本之间的关键权衡:高性能LLM通常会产生巨大的费用,而经济实惠的小型语言模型(SLM)则受限于能力有限。当前研究主要提出了两种路由策略:预生成路由和级联路由。两种方法各有特点,级联路由通常虽然延迟更高,但在成本效益和准确性方面表现更优。为进一步解决两种方法的局限性,我们引入SATER,一种双模式兼容的方法,通过最短响应偏好优化和置信度感知的拒绝机制对模型进行微调。SATER显著减少了冗余输出和响应时间,同时提升了预生成路由的性能和级联路由的效率。在三个SLM和六个数据集上进行实验,数据集类型和复杂度各异,结果显示SATER在保持可比性能的同时,持续将计算成本降低50%以上,将级联延迟降低80%以上。
引用
@article{arxiv.2510.05164,
title = {SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading},
author = {Yuanzhe Shen and Yide Liu and Zisu Huang and Ruicheng Yin and Xiaoqing Zheng and Xuanjing Huang},
journal= {arXiv preprint arXiv:2510.05164},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main