使用 GPT-3 总结、简化与综合医学证据(成败参半)
计算与语言
2023-05-12 v2
摘要
大语言模型,特别是 GPT-3,能够在少样本和零样本设置下生成通用领域新闻文章的高质量摘要。然而,尚不清楚此类模型在诸如生物医学等更专业、高风险的领域是否具备类似能力。本文邀请领域专家(具有医学训练的人员)来评估 GPT-3 在零监督下生成的生物医学文章摘要。我们考量了单文档与多文档两种设置。在前者中,GPT-3 被要求为描述随机对照试验的文章生成常规摘要与通俗语言摘要;在后者中,我们评估 GPT-3 能在多大程度上综合一组文章所报告的证据。我们设计了一套用于评估模型输出的标注方案,重点评估生成摘要的事实准确性。我们发现,虽然 GPT-3 能够忠实地总结并简化单篇生物医学文章,但难以对多篇文档的发现进行准确聚合。我们发布了本工作中使用的所有数据与标注。
引用
@article{arxiv.2305.06299,
title = {Summarizing, Simplifying, and Synthesizing Medical Evidence Using GPT-3 (with Varying Success)},
author = {Chantal Shaib and Millicent L. Li and Sebastian Joseph and Iain J. Marshall and Junyi Jessy Li and Byron C. Wallace},
journal= {arXiv preprint arXiv:2305.06299},
year = {2023}
}
备注
Accepted short paper to ACL 2023