可学习的 Chernoff 基准用于推理时对齐
机器学习
2026-02-16 v2 人工智能
摘要
我们研究生成模型的推理时奖励引导对齐。现有方法通常依赖于特定于体系结构的调整或计算昂贵的推理程序。我们引入可学习的 Chernoff 基准 (Learnable Chernoff Baselines, LCBs) 作为一种高效且近似地从 KL 正则化奖励对齐中产生的指数倾斜核中进行采样的方法。仅通过对预训练模型的黑盒采样访问,LCBs 实现了一种通过自适应选择接受概率来实现的拒绝采样形式,这允许对推理计算比例进行细粒度的控制。我们建立了到理想对齐模型的总变差保证,并在连续和离散扩散设置中表明,LCB 采样在使用大幅减少对预训练模型查询次数的情况下,与理想拒绝采样接近。
关键词
引用
@article{arxiv.2602.07738,
title = {Learnable Chernoff Baselines for Inference-Time Alignment},
author = {Sunil Madhow and Yuchen Liang and Ness Shroff and Yingbin Liang and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2602.07738},
year = {2026}
}