长式问答评测方法的批判性评估
计算与语言
2023-05-30 v1
摘要
长式问答(LFQA)能够回答广泛的问题,但其灵活性给评测带来了巨大挑战。我们首次针对长式答案的评测开展定向研究,涵盖人工与自动评测实践。我们聘请七个领域的领域专家,对答案对提供偏好判断,并附上其选择的自由形式理由。我们对专家评测进行了细致分析,重点关注答案的全面性等新方面。接着,我们考察了自动文本生成指标,发现现有指标均无法预测人类偏好判断。然而,部分指标与答案的细粒度方面(如连贯性)相关。我们鼓励未来工作摒弃对答案的单一“总体评分”,转而采用多维度评测,针对事实性与完整性等方面。我们公开发布所有标注与代码,以推动 LFQA 评测的后续研究。
引用
@article{arxiv.2305.18201,
title = {A Critical Evaluation of Evaluations for Long-form Question Answering},
author = {Fangyuan Xu and Yixiao Song and Mohit Iyyer and Eunsol Choi},
journal= {arXiv preprint arXiv:2305.18201},
year = {2023}
}
备注
ACL 2023 Camera Ready, Code available at https://github.com/carriex/lfqa_eval