中文

大语言模型尚非抽象摘要任务中的人类水平评估器

计算与语言 2023-10-23 v2

摘要

随着 ChatGPT 和 GPT-4 等大语言模型(LLMs)推理能力近期不可否认的提升,使用 LLMs 处理各类任务的趋势日益增长。LLMs 可应用的一个领域是作为复杂生成任务的替代评估指标,这类任务通常需要昂贵的人类评判者来补充流畅度与一致性等传统自动指标在各个评估维度上的不足。在本工作中,我们进行了广泛分析,以考察 LLMs 作为抽象摘要自动评估器的稳定性与可靠性。我们发现,尽管 ChatGPT 和 GPT-4 优于常用的自动指标,但由于显著的局限性,它们尚不能作为人类的替代。具体而言,LLM 评估器对每个候选系统的评分不一致,且依赖于具体维度。它们也难以比较性能接近的候选系统,并且随着摘要质量提高,其与人类的相关性降低,从而变得更加不可靠。换言之,随着更优的抽象摘要系统快速涌现,LLMs 可能导致误导且不可靠的评估。

关键词

引用

@article{arxiv.2305.13091,
  title  = {Large Language Models are Not Yet Human-Level Evaluators for Abstractive Summarization},
  author = {Chenhui Shen and Liying Cheng and Xuan-Phi Nguyen and Yang You and Lidong Bing},
  journal= {arXiv preprint arXiv:2305.13091},
  year   = {2023}
}

备注

19 pages, 5 figures