中文

基于假设重加权的测试时对齐

机器学习 2026-04-21 v2

摘要

在聚合偏好上训练的奖励模型往往无法捕捉 individual users' values,但现有的适应方法如微调或长情境 conditioning 成本太高,难以实现实时 personal ization。我们提出假设重加权(HyRe),通过仅使用来自目标用户或 domain 的 1-5 个标记示例即可实现实时 personal ization。我们的方法基于当不同 heads 捕捉对偏好数据的不同有效解释时,对其进行重加权可显著优于均匀平均的经验观察。HyRe 通过训练单个网络并配备多个 prediction heads 来捕捉偏好数据的不同有效解释,然后使用贝叶斯更新来提高与目标用户偏好最匹配的 heads 的权重。这仅需一次前向传播,计算开销可忽略不计(<1%),因此实用于推理时 personal ization。我们在 diverse target preference distributions 上评估了 HyRe。仅需每个 target distribution 五个偏好对,HyRe 就在 RewardBench 上超过了 2B 和 8B 规模的最先进奖励模型,并在 32 个 personal ization 任务中提升了奖励模型准确率 20%。

关键词

引用

@article{arxiv.2412.08812,
  title  = {Test-Time Alignment via Hypothesis Reweighting},
  author = {Yoonho Lee and Jonathan Williams and Henrik Marklund and Archit Sharma and Eric Mitchell and Anikait Singh and Chelsea Finn},
  journal= {arXiv preprint arXiv:2412.08812},
  year   = {2026}
}

备注

TMLR 2026