MedReadMe:医学领域细粒度句子可读性的系统研究
计算与语言
2024-10-29 v3
摘要
医学文本的阅读难度众所周知。恰当地衡量其可读性是使其更易理解的第一步。在本文中,我们提出了一项关于医学领域句子级和片段级细粒度可读性测量的系统研究。我们引入了一个新的数据集MedReadMe,它包含对4,520个句子的人工标注可读性评级和细粒度复杂片段标注,并具有两个新颖的“Google-Easy”和“Google-Hard”类别。它支持我们的定量分析,该分析涵盖了650个语言特征以及自动复杂词和术语识别。凭借我们高质量的标注,我们专门针对医学领域基准测试并改进了几种最先进的句子级可读性度量标准,其中包括使用最新开发的大型语言模型(LLMs)的无监督、有监督和基于提示的方法。基于我们的细粒度复杂片段标注,我们发现,在现有的可读性公式中添加一个捕捉术语片段数量的单一特征,可以显著提高其与人类判断的相关性。数据可在 tinyurl.com/medreadme-repo 获取。
引用
@article{arxiv.2405.02144,
title = {MedReadMe: A Systematic Study for Fine-grained Sentence Readability in Medical Domain},
author = {Chao Jiang and Wei Xu},
journal= {arXiv preprint arXiv:2405.02144},
year = {2024}
}
备注
This paper has been accepted as oral presentation at EMNLP 2024 main conference