Optimas:基于全局对齐局部奖励的复合 AI 系统优化
机器学习
2026-02-10 v4 人工智能
摘要
复合 AI 系统(集成大语言模型、专用工具和传统机器学习模型)正日益用于解决复杂的实际任务。然而,由于其非可微结构和组件之间配置类型的多样性(包括提示、超参数和模型参数),复合系统的优化仍然具有挑战性。为此,我们提出了 Optimas,一个用于复合系统有效优化的统一框架。Optimas 的核心思想是为每个组件维护一个局部奖励函数(Local Reward Function, LRF),每个函数都满足局部-全局对齐属性,即每个组件的局部奖励与全局系统性能相关。在每一次迭代中,Optimas 高效地调整 LRF 以维持这一属性,同时最大化每个组件的局部奖励。这一方法使我们能够使用指定的优化方法独立更新异构配置,同时确保局部改进始终导致性能提升。我们在五个真实世界的复合系统上进行了广泛评估,表明 Optimas 相较于强大基准平均提升了 11.92%,为改进复合系统提供了一种通用且有效的方法。我们的网站位于 https://optimas.stanford.edu。
引用
@article{arxiv.2507.03041,
title = {Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards},
author = {Shirley Wu and Parth Sarthi and Shiyu Zhao and Aaron Lee and Herumb Shandilya and Adrian Mladenic Grobelnik and Nurendra Choudhary and Eddie Huang and Karthik Subbian and Linjun Zhang and Diyi Yang and James Zou and Jure Leskovec},
journal= {arXiv preprint arXiv:2507.03041},
year = {2026}
}
备注
Accepted to ICLR 2026. 22 pages