中文

MedSTS:一种用于临床语义文本相似度的资源

信息检索 2018-08-29 v1

摘要

电子健康记录(EHRs)的广泛采用使得大量利用 EHR 数据的应用成为可能。然而,EHR 数据的有意义使用在很大程度上取决于我们高效提取和整合嵌入临床文本中信息的能力,而自然语言处理(NLP)技术至关重要。衡量文本片段间语义相似度的语义文本相似度(STS)在许多 NLP 应用中发挥着重要作用。在通用 NLP 领域,STS 共享任务已提供大量来自不同领域带人工标注的文本片段对。在临床领域,STS 能使我们检测并消除可能导致认知负担降低和临床决策过程改善的冗余信息。本文详述了我们组装医学领域 STS 资源 MedSTS 的努力。它包含总计 174,629 个从梅奥诊所临床语料库收集的句子对。MedSTS 的一个子集(MedSTS_ann)包含 1,068 个句子对,由两名医学专家以 0-5(低到高相似度)的语义相似度分数标注。我们进一步分析了 MedSTS 语料库中的医学概念,并在 MedSTS_ann 语料库上测试了四个 STS 系统。未来,我们将通过发布 MedSTS_ann 语料库来组织一项共享任务,以激励学界解决真实世界的临床问题。

关键词

引用

@article{arxiv.1808.09397,
  title  = {MedSTS: A Resource for Clinical Semantic Textual Similarity},
  author = {Yanshan Wang and Naveed Afzal and Sunyang Fu and Liwei Wang and Feichen Shen and Majid Rastegar-Mojarad and Hongfang Liu},
  journal= {arXiv preprint arXiv:1808.09397},
  year   = {2018}
}