一个用于生物医学摘要通俗语言改编的数据集
计算与语言
2022-10-25 v1 人工智能
摘要
尽管呈指数增长的健康相关文献已在线提供给广大受众,但科学文章的语言对公众而言可能难以理解。因此,将这些专家级语言改编为通俗语言版本,对于公众可靠理解海量健康相关文献是必要的。用于自动改编的深度学习算法是一种可能的解决方案;然而,需要黄金标准数据集以进行恰当评估。迄今提出的 dataset 要么由可比较的专业面向与公众面向文档对组成,要么由从此类文档中挖掘的语义相似句对组成。这导致了不完美对齐与小测试集之间的权衡。为解决此问题,我们创建了生物医学摘要通俗语言改编数据集。该数据集是首个同时实现文档级与句子级对齐的手动改编数据集。数据集包含750篇改编摘要,共计7643个句对。除描述该数据集外,我们使用最先进的深度学习方法来基准测试数据集上的自动改编,为未来研究设定基线。
引用
@article{arxiv.2210.12242,
title = {A Dataset for Plain Language Adaptation of Biomedical Abstracts},
author = {Kush Attal and Brian Ondov and Dina Demner-Fushman},
journal= {arXiv preprint arXiv:2210.12242},
year = {2022}
}
备注
12 pages, 4 figures, 7 tables