LFQA-HP-1M: A Large-Scale Human Preference Dataset for Long-Form Question Answering
计算与语言
2026-03-02 v1 人工智能
信息检索
摘要
Long-form question answering (LFQA) 需要对多句解释性回答进行细致评估,但现有指标往往无法反映人类判断。我们提出了 LFQA-HP-1M 数据集,包含 130 万人类两两偏好标注,用于 LFQA。我们提出了九个评估答案质量的评估标准,并表明基于这些特征的简单线性模型的表现与当前最先进的大语言模型评估器相当。我们进一步检查了 LLM 评估器在传递一致性、位置偏差和 verbosity 偏差方面的表现,并展示了其对对抗性扰动的脆弱性。总体而言,本工作提供了规模最大的公共 LFQA 偏好数据集以及一个以评估标准为导向的透明可靠评估框架。
引用
@article{arxiv.2602.23603,
title = {LFQA-HP-1M: A Large-Scale Human Preference Dataset for Long-Form Question Answering},
author = {Rafid Ishrak Jahan and Fahmid Shahriar Iqbal and Sagnik Ray Choudhury},
journal= {arXiv preprint arXiv:2602.23603},
year = {2026}
}
备注
LREC 2026 Accepted. https://huggingface.co/datasets/nlpatunt/LFQA-HP-1M