中文

基于基础语言模型的文本摘要零样本忠实性评估

计算与语言 2023-12-15 v2

摘要

尽管自然语言生成取得了巨大进展,摘要模型仍受不忠实问题困扰。已有工作或使用基于其他任务或域内合成数据训练的模型,或提示 ChatGPT 等大型模型来评估忠实性。本文提出仅用中等规模的基础语言模型进行零样本忠实性评估。我们引入新指标 FFLM,其基于如下直觉——为输出前缀一段与之一致文本将提高预测该输出的概率,由概率变化组合而成。实验表明,FFLM 在不一致检测与忠实性评分上以少 24 倍参数即可与 ChatGPT 竞争甚至优于之。FFLM 亦相较其他强基线取得提升。

关键词

引用

@article{arxiv.2310.11648,
  title  = {Zero-shot Faithfulness Evaluation for Text Summarization with Foundation Language Model},
  author = {Qi Jia and Siyu Ren and Yizhu Liu and Kenny Q. Zhu},
  journal= {arXiv preprint arXiv:2310.11648},
  year   = {2023}
}

备注

Accepted by EMNLP2023