Conformal Arbitrage:语言模型中竞争目标的风险控制平衡
人工智能
2025-06-03 v1
摘要
现代语言模型部署通常必须平衡竞争目标,例如有用性与无害性、成本与准确性、奖励与安全性。我们引入Conformal Arbitrage,一个事后框架,通过学习数据驱动的阈值来在针对主要目标优化的主模型与更保守的守护者之间进行调解,后者可以是另一个模型或与护栏目标对齐的人类领域专家。该阈值通过保形风险控制进行校准,提供有限样本、无分布的保证,确保不良事件(如事实错误或安全违规)的长期频率不超过用户指定的配额。由于Conformal Arbitrage完全在API层面运行,无需访问模型logits或更新模型权重,它补充了基于权重的对齐技术,并无缝集成到现有的成本感知级联中。从经验上看,Conformal Arbitrage描绘了有效前沿,允许用户为一个目标定义可接受的性能水平,同时最大化另一个目标的效用。我们观察到,在准确性方面,我们的方法优于模型间成本匹配的随机路由。这些特性使Conformal Arbitrage成为跨广泛潜在竞争目标可信且经济地部署大型语言模型的实用、理论基础扎实的工具。
引用
@article{arxiv.2506.00911,
title = {Conformal Arbitrage: Risk-Controlled Balancing of Competing Objectives in Language Models},
author = {William Overman and Mohsen Bayati},
journal= {arXiv preprint arXiv:2506.00911},
year = {2025}
}