Humanline:将在线对齐视为感知损失
人工智能
2026-03-30 v2
摘要
在线对齐(如GRPO)通常比离线对齐(如DPO)更具性能优势——但原因何在?我们从行为经济学中的前景理论出发,提出一种以人类为中心的解释。我们证明,基于人类的在线策略抽样更准确地逼近模型可产生结果的人类感知分布,而PPO/GRPO式的裁剪——最初仅为稳定训练而引入——恰好恢复了人类对概率感知的偏差。从而,PPO/GRPO实际上已是感知损失。在我们的理论进一步表明,线上/离线二分本身并非最大化人类效用之所必,因我们可通过选择性地训练于任何数据,以模仿人类感知的方式来实现相同的效果,而无需局限于在线策略数据。如此一来,我们即可更快捷地进行后训练。为此,我们提出一种设计模式,显式地将概率的感知扭曲纳入目标函数,如DPO/KTO/GRPO,形成humanline变体。令人惊讶的是,即使使用离线离策略数据训练,这些humanline变体仍能匹配其在线对应版本的性能(在可验证与不可验证任务上皆如此),且速度可提升最高达6倍。
引用
@article{arxiv.2509.24207,
title = {Humanline: Online Alignment as Perceptual Loss},
author = {Sijia Liu and Niklas Muennighoff and Kawin Ethayarajh},
journal= {arXiv preprint arXiv:2509.24207},
year = {2026}
}