中文

人类判断与 LLM 判断的对齐:来自 EvalAssist 关于任务特定评估和 AI 辅助评估偏好的洞见

人机交互 2025-08-07 v2

摘要

评估大型语言模型(LLM)输出需要用户对各种配置中最佳输出进行关键判断。由于数据量大,这一过程代价高昂且耗时。LLMs 越来越多地用作评估器,用于过滤训练数据、评估模型性能或协助人类评估者进行详细评估。为支持这一过程,有效的前端工具对于评估至关重要。使用 LLMs 作为评估器的两种常见方法是直接评估和两两比较。我们随机器学习从业者(n=15)进行的研究中,每位受试者完成 6 个任务,共计 131 次评估,我们探讨了任务相关因素和评估策略如何影响准则细化和用户感知。研究结果显示,用户通过使准则具有任务特定性、修改判断并更改评估模型,进行直接评估时完成的评估次数更多。我们随后提出了如何使系统更好地支持 LLM 辅助评估中的交互的建议。

关键词

引用

@article{arxiv.2410.00873,
  title  = {Aligning Human and LLM Judgments: Insights from EvalAssist on Task-Specific Evaluations and AI-assisted Assessment Strategy Preferences},
  author = {Zahra Ashktorab and Michael Desmond and Qian Pan and James M. Johnson and Martin Santillan Cooper and Elizabeth M. Daly and Rahul Nair and Tejaswini Pedapati and Hyo Jin Do and Werner Geyer},
  journal= {arXiv preprint arXiv:2410.00873},
  year   = {2025}
}