中文

LLM 生成的平实语言摘要是否真的易于理解?大规模众所瞩目评估

计算与语言 2025-05-16 v1

摘要

平实语言摘要(PLSA)对于通过使复杂医学信息更易于普通人理解和操作,促进医生和患者之间有效沟通至关重要。大型语言模型(LLM)最近在自动生成 PLSA 上显示出前景,但其在支持健康信息理解方面的效果仍不明确。以往的评估通常依赖于不直接衡量易理解性的自动得分,或来自便利抽样样本的主观 Likert 量表评级,其普遍性有限。为弥合这一差距,我们采用 Amazon Mechanical Turk 对 LLM 生成的 PLSA 进行了大规模众所瞩目评估,纳入 150 名参与者。我们通过关注简洁性、信息量、连贯性和忠实性的主观 Likert 量表评级;以及客观的多选题理解和回忆措施来评估读者理解水平。此外,我们还检验了 10 项自动评估指标与人类判断之间的对齐情况。我们的发现表明,尽管 LLM 可以生成看似与人类撰写的 PLSA 无异的主观评估,但人类撰写的 PLSA 仍显著优于后者的理解效果。进一步地,自动评估指标未能反映人类判断,这质疑了其用于评估 PLSA 的适用性。这项研究首次系统评估了基于读者偏好和理解结果的 LLM 生成的 PLSA。我们的发现凸显了需要超越表层质量的评估框架,以及致力于普通人理解的生成方法。

关键词

引用

@article{arxiv.2505.10409,
  title  = {Are LLM-generated plain language summaries truly understandable? A large-scale crowdsourced evaluation},
  author = {Yue Guo and Jae Ho Sohn and Gondy Leroy and Trevor Cohen},
  journal= {arXiv preprint arXiv:2505.10409},
  year   = {2025}
}