通过系统级 DPO 对齐复合 AI 系统
机器学习
2026-03-09 v4 人工智能
多智能体系统
摘要
由大语言模型、基础模型和外部工具等多个交互组件构成的复合 AI 系统,在各种任务中相比单一模型已展现出显著改进。为确保其在现实应用中的有效部署,使这些系统与人类偏好对齐至关重要。然而,与单一模型的对齐不同,通过策略优化对齐复合系统面临两大挑战:(i) 组件间的不可微交互使得端到端的基于梯度的优化方法不适用;(ii) 系统级偏好无法直接转化为组件级偏好。为应对这些挑战,我们首先将复合 AI 系统形式化为有向无环图(DAG),显式地建模组件交互及其关联的数据流。基于此形式化,我们引入了 ,一个扩展直接偏好优化(DPO)以实现联合系统级对齐的框架。我们提出了两种变体,SysDPO-Direct 和 SysDPO-Sampling,分别适用于是否构建系统特定偏好数据集的不同场景。我们通过两个应用实证证明了方法的有效性:一个语言模型与一个扩散模型的联合对齐,以及一个 LLM 协作系统的联合对齐。
引用
@article{arxiv.2502.17721,
title = {Aligning Compound AI Systems via System-level DPO},
author = {Xiangwen Wang and Yibo Jacky Zhang and Zhoujie Ding and Katherine Tsai and Haolun Wu and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2502.17721},
year = {2026}
}
备注
NeurIPS 2025