中文

基于代理的测试时对齐拒绝准则

计算与语言 2026-04-21 v2

摘要

最近的工作提出了基于小型对齐模型作为代理来指导大型基模型(未对齐)生成的测试时对齐方法。隐式奖励方法会扭曲大型模型的分布,而轻推方法则在大型基模型对其结果不够自信时,将下一个标记的生成推迟给小型对齐模型。在本工作中,我们首先表明两种方法可还原为类似的图模型抽样,其中仅在拒绝准则(或分布)的定义上存在差异。此外,我们认为置信准则由于语言现象如模糊表述而不够合理。我们提出了一种基于保守置信赌注的新型拒绝准则。实验表明,我们的新方法在多个数据集上 outperform 以前的工作。

关键词

引用

@article{arxiv.2604.16146,
  title  = {On the Rejection Criterion for Proxy-based Test-time Alignment},
  author = {Ayoub Hammal and Pierre Zweigenbaum and Caio Corro},
  journal= {arXiv preprint arXiv:2604.16146},
  year   = {2026}
}

备注

ACL 2026 Main