Duel-Evolve:基于LLM自偏好的无奖励测试时扩展
机器学习
2026-02-27 v1 人工智能
计算与语言
机器学习
摘要
许多应用寻求在测试时优化LLM输出,通过迭代提议、评分和细化候选解于离散输出空间。现有方法使用校准的标量评估器来指导搜索,但许多任务缺乏此类评分,或稀疏或不可靠。相比之下,成对比较往往更容易获取,仍提供有用的改进方向信号,可无需外部监督从LLM本身获取。基于这一观察,我们引入Duel-Evolve,一种将外部标量奖励替换为来自同一LLM生成候选解的成对偏好所致的进化优化算法。Duel-Evolve通过贝叶斯Bradley-Terry模型聚合这些噪声候选比较,生成不确定性感知的候选质量估计。这些质量估计使用Double Thompson Sampling指导比较预算分配 toward plausible optima,以及选择高质量父代以生成改进后的候选解。在MathBench上,该方法实现了比现有方法和基线高达20个百分点的准确率;在LiveCodeBench上,相较于可比迭代方法提升超过12个百分点。值得注意的是,该方法无需奖励模型、无需搜索期间的ground-truth标签,亦无需手工设计的评分函数。结果表明,成对自我偏好为大型离散输出空间的测试时改进提供了强大的优化信号。
关键词
引用
@article{arxiv.2602.21585,
title = {Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences},
author = {Sweta Karlekar and Carolina Zheng and Magnus Saebo and Nicolas Beltran-Velez and Shuyang Yu and John Bowlan and Michal Kucer and David Blei},
journal= {arXiv preprint arXiv:2602.21585},
year = {2026}
}