中文

我的人类反馈里有什么?学习偏好数据的可解释描述

计算与语言 2026-04-14 v2 人工智能

摘要

人类反馈可能以不可预测和不受欢迎的方式改变语言模型,因为实践者缺乏对反馈数据编码内容的清晰理解。虽然先前的工作研究了关于某些属性(例如长度或谄媚)的偏好,但在没有预先指定假设的情况下自动提取相关特征仍然具有挑战性。我们引入了“我的人类反馈里有什么?”(WIMHF),一种使用稀疏自编码器解释反馈数据的方法。WIMHF刻画了(1)数据集能够衡量的偏好,以及(2)标注者实际表达的偏好。在7个数据集上,WIMHF识别出少量人类可解释的特征,这些特征解释了黑盒模型实现的大部分偏好预测信号。这些特征揭示了人类偏好的广泛多样性,以及数据集层面上下文的作用:例如,Reddit用户更喜欢非正式和笑话,而HH-RLHF和PRISM中的标注者则不喜欢它们。WIMHF还揭示了潜在不安全的偏好,例如LMArena用户倾向于投票反对拒绝回答,通常支持有毒内容。学习到的特征使得有效的数据整理成为可能:对Arena中的有害示例重新标注,在不对一般性能造成损失的情况下,带来了巨大的安全性提升(+37%)。它们还允许细粒度的个性化:在Community Alignment数据集上,我们学习了标注者特定的、关于主观特征的权重,从而改进了偏好预测。WIMHF为实践者提供了一种以人为中心的分析方法,以更好地理解和使用偏好数据。

关键词

引用

@article{arxiv.2510.26202,
  title  = {What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data},
  author = {Rajiv Movva and Smitha Milli and Sewon Min and Emma Pierson},
  journal= {arXiv preprint arXiv:2510.26202},
  year   = {2026}
}

备注

ICLR 2026 (oral). v2 adds SAE ablations and robustness checks. Code: https://github.com/rmovva/wimhf; Demo: https://rajivmovva.com/demo-wimhf/