中文

跨领域零样摘要生成的事实性评估

计算与语言 2024-02-07 v1 人工智能 机器学习

摘要

近期研究表明,大型语言模型(LLM)能够以零样方式(即无需显式监督)生成摘要,这些摘要在人类评估下常常与人工编写的参考摘要相当甚至更佳。然而,这些研究几乎仅聚焦于新闻文章摘要的评估。在其他(可能更专业)领域,零样摘要生成器的表现如何?本文评估了跨专业领域的零样生成摘要,包括生物医学文章和法律法案(除标准新闻基准外)。我们特别关注输出的事实性。我们获取了领域专家的标注,用于识别摘要中的不一致并系统性地分类这些错误。我们分析了给定领域在预训练语料库中的出现频率是否影响生成摘要的可提取性和忠实度。我们公开所有收集的标注,以促进超越新闻文章的事实准确摘要评估与实现。该数据集可在 https://github.com/sanjanaramprasad/zero_shot_faceval_domains 下载。

关键词

引用

@article{arxiv.2402.03509,
  title  = {Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains},
  author = {Sanjana Ramprasad and Kundan Krishna and Zachary C Lipton and Byron C Wallace},
  journal= {arXiv preprint arXiv:2402.03509},
  year   = {2024}
}