基于代理的测试时对齐拒绝准则
计算与语言
2026-04-21 v2
摘要
最近的工作提出了基于小型对齐模型作为代理来指导大型基模型(未对齐)生成的测试时对齐方法。隐式奖励方法会扭曲大型模型的分布,而轻推方法则在大型基模型对其结果不够自信时,将下一个标记的生成推迟给小型对齐模型。在本工作中,我们首先表明两种方法可还原为类似的图模型抽样,其中仅在拒绝准则(或分布)的定义上存在差异。此外,我们认为置信准则由于语言现象如模糊表述而不够合理。我们提出了一种基于保守置信赌注的新型拒绝准则。实验表明,我们的新方法在多个数据集上 outperform 以前的工作。
引用
@article{arxiv.2604.16146,
title = {On the Rejection Criterion for Proxy-based Test-time Alignment},
author = {Ayoub Hammal and Pierre Zweigenbaum and Caio Corro},
journal= {arXiv preprint arXiv:2604.16146},
year = {2026}
}
备注
ACL 2026 Main