中文

来自 TREC 生物医学摘要平易语言改编 (PLABA) 赛道的经验

计算与语言 2025-07-23 v2 人工智能 信息检索

摘要

目的:语言模型的最新进展显示出将面向专业人员的生物医学文献改编为平易语言的潜力,使其对患者和护理人员变得易于理解。然而,其不可预测性加上该领域极高的潜在危害风险,意味着必须进行严格的评估。我们设立该赛道的目的是激发研究,并对最有前途的系统提供高质量评估。方法:我们在 2023 年和 2024 年的文本检索会议 (TREC) 上举办了生物医学摘要平易语言改编 (PLABA) 赛道。任务包括摘要的完整、句子级重写 (任务 1) 以及识别和替换困难术语 (任务 2)。为了对任务 1 进行自动评估,我们开发了一套四重专业编写的参考集。任务 1 和任务 2 的提交均由生物医学专家进行了广泛的人工评估。结果:来自 12 个国家的 12 个团队参与了该赛道,模型从多层感知机到大型预训练 Transformer 不等。在任务 1 的人工评判中,表现最佳的模型在事实准确性和完整性上达到了人类水平,但在简洁性或简明性上则不然。基于参考的自动指标通常与人工评判相关性不佳。在任务 2 中,系统在识别困难术语和分类如何替换它们方面存在困难。然而,在生成替换时,基于 LLM 的系统在人工评判的准确性、完整性和简洁性方面表现良好,尽管在简明性上表现不佳。结论:PLABA 赛道展示了使用大型语言模型 (LLM) 为公众改编生物医学文献的前景,同时也突出了其缺陷以及对改进的自动基准测试工具的需求。

关键词

引用

@article{arxiv.2507.14096,
  title  = {Lessons from the TREC Plain Language Adaptation of Biomedical Abstracts (PLABA) track},
  author = {Brian Ondov and William Xia and Kush Attal and Ishita Unde and Jerry He and Dina Demner-Fushman},
  journal= {arXiv preprint arXiv:2507.14096},
  year   = {2025}
}