SuMe:面向生物医学机制摘要的数据集
计算与语言
2023-01-13 v1 人工智能
信息检索
机器学习
摘要
语言模型能否阅读生物医学文本并解释其中讨论的生物医学机制?在本工作中,我们引入了一个生物医学机制摘要任务。生物医学研究常探究某一实体(如蛋白质或化学物质)在生物语境中如何影响另一实体的机制。这些发表的论文摘要通常包含一组聚焦的句子,呈现关于此类关系的支持性陈述、相关实验证据,以及总结该关系背后机制的总结句。我们利用这一结构创建了一个摘要任务,其输入为摘要中的一组句子和主要实体,输出包括关系及总结机制的句子。利用少量人工标注的机制句子,我们训练了一个机制句子分类器来筛选大型生物医学摘要集合,创建了包含 22k 个实例的摘要数据集。我们还引入了包含 611k 个实例的总结句生成作为预训练任务。我们对大型生物领域语言模型进行了性能基准测试。我们发现,尽管预训练任务有助于提升性能,最佳模型仅在 32% 的实例中生成可接受的机制输出,这表明该任务在生物医学语言理解与摘要方面存在显著挑战。
引用
@article{arxiv.2205.04652,
title = {SuMe: A Dataset Towards Summarizing Biomedical Mechanisms},
author = {Mohaddeseh Bastan and Nishant Shankar and Mihai Surdeanu and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:2205.04652},
year = {2023}
}
备注
Accepter at LREC2022