基于基础语言模型的文本摘要零样本忠实性评估
计算与语言
2023-12-15 v2
摘要
尽管自然语言生成取得了巨大进展,摘要模型仍受不忠实问题困扰。已有工作或使用基于其他任务或域内合成数据训练的模型,或提示 ChatGPT 等大型模型来评估忠实性。本文提出仅用中等规模的基础语言模型进行零样本忠实性评估。我们引入新指标 FFLM,其基于如下直觉——为输出前缀一段与之一致文本将提高预测该输出的概率,由概率变化组合而成。实验表明,FFLM 在不一致检测与忠实性评分上以少 24 倍参数即可与 ChatGPT 竞争甚至优于之。FFLM 亦相较其他强基线取得提升。
引用
@article{arxiv.2310.11648,
title = {Zero-shot Faithfulness Evaluation for Text Summarization with Foundation Language Model},
author = {Qi Jia and Siyu Ren and Yizhu Liu and Kenny Q. Zhu},
journal= {arXiv preprint arXiv:2310.11648},
year = {2023}
}
备注
Accepted by EMNLP2023