动态混合精度路由:高效多步骤 LLM 交互
人工智能
2026-05-15 v2
摘要
大型语言模型(LLM)通过在测试时进行多步骤交互和推理,在长程决策任务中实现了出色的性能。虽然实践者常常认为更高的任务成功率需要更大更强的 LLM 模型,但与大型 LLM 的多步骤交互会导致高昂的推理成本。为此,我们探索在长程决策过程中使用低精度量化 LLM。基于各交互步骤不同灵敏度的观察,我们提出动态混合精度路由(DMR),该框架在每个决策步骤自适应地在高精度和低精度 LLM 之间进行选择。路由器通过两个阶段的管道进行训练,包括基于 KL 散度的监督学习以识别精度敏感步骤,随后使用 GRPO(Group-Relative Policy Optimization)进一步提高任务成功率。ALFWorld 和 WebShop 上的实验表明,我们的方法在单精度基线的准确率-成本权衡方面表现出色。
引用
@article{arxiv.2602.02711,
title = {Dynamic Mixed-Precision Routing for Efficient Multi-step LLM Interaction},
author = {Yuanzhe Li and Jianing Deng and Jingtong Hu and Tianlong Chen and Song Wang and Huanrui Yang},
journal= {arXiv preprint arXiv:2602.02711},
year = {2026}
}