当弱 LLM 带着把握自信时,偏好对齐变得更强
计算与语言
2026-03-06 v1 人工智能
摘要
偏好对齐是将大型语言模型(LLM)适配人类价值观的关键步骤,但现有方法通常依赖高昂的人类标注或大规模基于 API 的模型。我们探讨了弱 LLM 是否能发挥有效的标注者作用。我们惊讶地发现,仅从弱 LLM 中挑选出高度自信样本的子集,性能远超使用完整的人类标注。基于这一洞见,我们提出了基于置信度加权的偏好优化(CW-PO)框架,该框架可重新权重训练样本中的置信度,并可适用于各种偏好优化目标。值得注意的是,使用仅20%的人类标注通过 CW-PO 对齐的模型,性能优于在标准 DPO 下使用100%标注的模型。这些结果表明,凭借置信加权,弱 LLM 在显著降低偏好对齐成本方面具有巨大的潜力,甚至能在完全人工标注数据上超越现有方法。
引用
@article{arxiv.2603.04968,
title = {When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger},
author = {Amirabbas Afzali and Myeongho Jeon and Maria Brbic},
journal= {arXiv preprint arXiv:2603.04968},
year = {2026}
}
备注
32 pages, 8 figures, International Conference on Learning Representations 2026