将测试时计算最优扩展概括为可优化图
机器学习
2025-11-04 v1 人工智能
计算与语言
摘要
测试时扩展(TTS)通过在推理期间分配额外计算资源来提高大型语言模型(LLM)的性能,通常通过并行、顺序或混合扩展方式实现。然而,既往研究常假设固定的协作架构(如拓扑结构)和单一模型使用,忽视最佳架构和模型组合可能因任务而异的事实。因此,本文研究了在固定预算下寻找计算最优模型组合与架构的新问题。我们将其形式化为多LLM协作图,其中节点编码角色与LLM模型分配,边缘捕获信息流。此问题具有挑战性,因为:(i)组合搜索空间庞大且难以覆盖;(ii)任务特定需求要求定制化设计。为此,我们将问题重新表述为概率图优化,并通过实验发现三项关于TTS协作图的经验性见解。基于这些见解,我们提出了Agent-REINFORCE,一种由LLM代理增强的框架,模拟REINFORCE管道,将抽样-梯度-更新映射为抽样-反馈-更新,其中反馈作为文本梯度用于更新概率图,从而高效搜索最优的多LLM协作图。实验表明,Agent-REINFORCE在样本效率和搜索性能方面均优于传统方法和基于LLM的基线方法,能够在准确率和推理延迟方面有效识别最优图。
引用
@article{arxiv.2511.00086,
title = {Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph},
author = {Fali Wang and Jihai Chen and Shuhua Yang and Runxue Bao and Tianxiang Zhao and Zhiwei Zhang and Xianfeng Tang and Hui Liu and Qi He and Suhang Wang},
journal= {arXiv preprint arXiv:2511.00086},
year = {2025}
}
备注
Under review