中文

LINKAGE:基于LLM用于非事实型问答评估的参考答案列表排序

计算与语言 2024-10-01 v2

摘要

非事实型(NF)问答是由于存在多样化的潜在答案且无客观标准而难以评估的。常用的自动评估指标如ROUGE或BERTScore无法准确衡量语义相似性或来自不同视角的答案。最近, 大语言模型(LLM)因在各种NLP任务中表现突出, 被用于NFQA评估。常见方法包括对每个候选答案进行单点评分和在答案之间进行两两比较。受从单点到双点再到列表排序方法在学习排序中的演进启发, 本文提出了一种新颖的列表级NFQA评估方法, 利用LLM对按质量降序排列的参考答案列表中的候选答案进行排序。此外, 对于没有多级或任何黄金答案的NF问题, 我们利用LLM生成不同质量的参考答案列表, 以促进列表级评估。在ANTIQUE、TREC-DL-NF和WebGLM等三个NFQA数据集上的大规模实验结果表明, 本方法在与人类注释相关性方面, 显著高于自动得分和常见的单点和双点方法。

关键词

引用

@article{arxiv.2409.14744,
  title  = {LINKAGE: Listwise Ranking among Varied-Quality References for Non-Factoid QA Evaluation via LLMs},
  author = {Sihui Yang and Keping Bi and Wanqing Cui and Jiafeng Guo and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2409.14744},
  year   = {2024}
}

备注

Published as a conference paper at EMNLP Findings 2024