DxHF:通过交互式分解为 LLM 对齐提供高质量人类反馈
人机交互
2025-07-28 v1 人工智能
摘要
人类偏好广泛用于通过如强化学习从人类反馈(RLHF)等方法来对大语言模型(LLM)进行对齐。然而,当前的用户界面要求标注员比较文本段落,当文本较长或不熟悉时,这种做法在认知上具有较大的挑战性。本文通过研究分解原理这一方法来提高 LLM 对齐的人类反馈质量。该方法将文本分解为单个论点,而不是直接比较两段冗长的文本回复。基于这一原理,我们构建了一个新的用户界面 DxHF。它通过显示分解后的论点、对论点与对话相关性的可视化编码以及链接相似论点来增强比较过程。这使用户能够快速浏览关键信息并识别差异,以便更好、更快地做出判断。我们的技术评估表明,分解方法在关于基准真实值的反馈准确性方面普遍具有积极影响,尤其是对于不确定性较大的用户。 crowdsourcing 研究中有 160 名参与者的实验结果表明,使用 DxHF 可平均提高 5% 的反馈准确性,尽管平均反馈时间增加了 18 秒。值得注意的是,在用户不确定性较低的情况下,准确性提升幅度显著。该研究的发现凸显了人机交互(HCI)作为提高人类-人工智能对齐质量的有效方法的潜力。
引用
@article{arxiv.2507.18802,
title = {DxHF: Providing High-Quality Human Feedback for LLM Alignment via Interactive Decomposition},
author = {Danqing Shi and Furui Cheng and Tino Weinkauf and Antti Oulasvirta and Mennatallah El-Assady},
journal= {arXiv preprint arXiv:2507.18802},
year = {2025}
}