中文

构建中文临床文本的综合句法与语义语料库

计算与语言 2016-11-09 v2

摘要

目标:构建一个涵盖中文临床文本句法与语义标注的综合语料库,并附带相应的标注指南与方法,以及开发基于该标注语料库训练的工具,为临床领域中文文本研究提供基线。材料与方法:提出一种迭代标注方法来培训标注人员并制定标注指南。随后,通过采用标注质量保证措施,构建了一个综合语料库,包含词性(POS)标签、句法标签、实体、断言与关系的标注。计算标注者间一致性(IAA)以评估标注质量,并基于我们的标注语料库开发了中文临床文本处理与信息抽取系统(CCTPIES)。结果:句法语料库由 138 篇中文临床文档组成,包含 47,424 个 token 和 2553 棵完整解析树,而语义语料库包含 992 篇文档,标注了 39,511 个实体及其断言和 7695 个关系。IAA 评估显示该综合语料库质量良好,且系统模块有效。讨论:该标注语料库对临床领域中文文本的自然语言处理(NLP)研究做出了重要贡献。然而,该语料库存在若干局限。应引入更多类型的临床文本以提高语料库覆盖率,并应采用主动学习方法来提升标注效率。结论:本研究提出了针对中文临床文本的若干标注指南与一种标注方法,并构建了一个带有其 NLP 模块的综合语料库,为进一步将 NLP 技术应用于临床领域中文文本的研究奠定了基础。

关键词

引用

@article{arxiv.1611.02091,
  title  = {Building a comprehensive syntactic and semantic corpus of Chinese clinical texts},
  author = {Bin He and Bin Dong and Yi Guan and Jinfeng Yang and Zhipeng Jiang and Qiubin Yu and Jianyi Cheng and Chunyan Qu},
  journal= {arXiv preprint arXiv:1611.02091},
  year   = {2016}
}

备注

27 pages, submitted to Journal of Biomedical Informatics