基于最长支撑子序列的忠实性评估
计算与语言
2023-08-24 v1 人工智能
摘要
随着日益复杂的语言模型的出现,其可信度成为一个关键问题,尤其在摘要与问答等任务中。由于其语言多样性及可能答案的繁杂,确保模型响应以上下文为依据且忠实颇具挑战。本文中,我们引入一种通过计算如下述 claim 中由上下文支撑的最长非连续子串来评估机器生成文本忠实性的新方法,我们称之为最长支撑子序列(LSS)。利用一个新的人工标注数据集,我们对一个模型进行微调以生成LSS。我们提出一种新的评估方法,并证明当采用LSS时,这些指标与人类评分的相关性优于不采用时。我们所提指标在我们数据集上比主流SOTA忠实性指标提升了18%。我们的指标在摘要数据集上跨六种不同模型始终优于其他指标。最后,我们利用该指标比较了若干流行大语言模型(LLM)的忠实性。我们发布了为预测LSS构建的人工标注数据集及用于评估忠实性的微调模型。
引用
@article{arxiv.2308.12157,
title = {Evaluation of Faithfulness Using the Longest Supported Subsequence},
author = {Anirudh Mittal and Timo Schick and Mikel Artetxe and Jane Dwivedi-Yu},
journal= {arXiv preprint arXiv:2308.12157},
year = {2023}
}