基于跨标注者偏好优化的Human Label Variation稳定信号: 学习标注者特定的解释行为
计算与语言
2026-05-28 v1
摘要
Free-text解释将Human Label Variation(HLV)超越标签不一致,揭示标注者决定背后的推理和偏好。我们研究大语言模型(LLMs)是否能够学习并再现此类标注者特定的标签-解释行为。使用两个带四个标注者的句子对任务——自然语言推理和改写判断——我们首先分析标注者是否存在稳定的个体模式。我们发现,由于强大的输入内容效应,这些模式在单个标注级别较弱,但在输入内容降低和标注者级别聚合后变得可检测。我们 then比较了prompting和监督微调(SFT)基线,并提出cross-annotator preference optimization(CAPO),该方法将目标标注者的响应与其他有效但不够目标特定的注释进行对比。实验表明,prompting受限且不稳定,SFT更好地捕捉标注者特定的行为,CAPO进一步提高了聚合感知的模仿和基于裁判的归因,同时在人类验证下保持目标特定的推理模式。总体而言,我们的结果表明,HLV可作为标注者特定的标签-解释行为来学习,表明了一种以标注者历史为基础而非仅限于标签的可扩展解释基于注释的路径。
引用
@article{arxiv.2605.28802,
title = {Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization},
author = {Beiduo Chen and Pingjun Hong and Ziyun Zhang and Benjamin Roth and Anna Korhonen and Barbara Plank},
journal= {arXiv preprint arXiv:2605.28802},
year = {2026}
}
备注
43 pages, 20 figures