中文

AlignScore:使用统一对齐函数评估事实一致性

计算与语言 2023-05-29 v1

摘要

许多文本生成应用要求生成文本与输入信息在事实上保持一致。事实一致性的自动评估具有挑战性。先前的工作开发了各种通常依赖于特定函数(如自然语言推理(NLI)或问答(QA))的度量指标,这些指标在有限数据上训练,因此难以评估来自不同任务、出现在不同输入/输出(如句子、文档)中的多种事实不一致(例如矛盾、幻觉)。本文提出 AlignScore,一种适用于上述各种事实不一致场景的新型整体度量指标。AlignScore 基于任意两段文本之间信息对齐的通用函数。关键的是,我们通过整合大量多样化数据源,开发了该对齐函数的统一训练框架,从而构建了来自 7 个成熟任务(NLI、QA、复述、事实核查、信息检索、语义相似度和摘要)的 470 万训练样本。我们在包含 22 个评估数据集的大规模基准上进行了广泛实验,其中 19 个数据集在对齐训练中从未见过。AlignScore 相较一系列先前指标取得了实质性改进。此外,AlignScore(3.55 亿参数)匹配甚至优于基于参数量级大得多的 ChatGPT 和 GPT-4 的度量指标。

关键词

引用

@article{arxiv.2305.16739,
  title  = {AlignScore: Evaluating Factual Consistency with a Unified Alignment Function},
  author = {Yuheng Zha and Yichi Yang and Ruichen Li and Zhiting Hu},
  journal= {arXiv preprint arXiv:2305.16739},
  year   = {2023}
}

备注

19 pages, 5 figures, ACL2023