中文

长式问答评测方法的批判性评估

计算与语言 2023-05-30 v1

摘要

长式问答(LFQA)能够回答广泛的问题,但其灵活性给评测带来了巨大挑战。我们首次针对长式答案的评测开展定向研究,涵盖人工与自动评测实践。我们聘请七个领域的领域专家,对答案对提供偏好判断,并附上其选择的自由形式理由。我们对专家评测进行了细致分析,重点关注答案的全面性等新方面。接着,我们考察了自动文本生成指标,发现现有指标均无法预测人类偏好判断。然而,部分指标与答案的细粒度方面(如连贯性)相关。我们鼓励未来工作摒弃对答案的单一“总体评分”,转而采用多维度评测,针对事实性与完整性等方面。我们公开发布所有标注与代码,以推动 LFQA 评测的后续研究。

关键词

引用

@article{arxiv.2305.18201,
  title  = {A Critical Evaluation of Evaluations for Long-form Question Answering},
  author = {Fangyuan Xu and Yixiao Song and Mohit Iyyer and Eunsol Choi},
  journal= {arXiv preprint arXiv:2305.18201},
  year   = {2023}
}

备注

ACL 2023 Camera Ready, Code available at https://github.com/carriex/lfqa_eval