Archon:面向推理时技术的架构搜索框架
机器学习
2025-06-12 v6 人工智能
计算与语言
摘要
推理时技术,如重复抽样或迭代修订,正成为增强大语言模型(LLM)的有效方法。然而,由于我们对这些技术在不同模型和任务上的效用、它们之间的相互作用以及组合它们的巨大搜索空间缺乏理解,开发能够整合这些技术的系统的最佳实践仍不成熟。为此,我们引入Archon,一个模块化且自动化的框架,用于优化选择和组合推理时技术与大语言模型的过程。给定计算预算和一组可用的大语言模型,Archon探索庞大的设计空间,以发现针对目标基准的优化配置。它可以设计出自定义或通用架构,使其在准确率与最大token预算的帕累托前沿上超越顶尖基准模型。在指令遵循、推理和编码任务方面,我们展示Archon能够利用额外的推理计算预算,设计出超越OpenAI o1、GPT-4o和Claude 3.5 Sonnet等前沿模型的系统,平均提升15.1%。
引用
@article{arxiv.2409.15254,
title = {Archon: An Architecture Search Framework for Inference-Time Techniques},
author = {Jon Saad-Falcon and Adrian Gamarra Lafuente and Shlok Natarajan and Nahum Maru and Hristo Todorov and Etash Guha and E. Kelly Buchanan and Mayee Chen and Neel Guha and Christopher Ré and Azalia Mirhoseini},
journal= {arXiv preprint arXiv:2409.15254},
year = {2025}
}
备注
International Conference on Machine Learning (ICML) 2025