中文

DiaKG:用于医学知识图谱构建的糖尿病标注数据集

计算与语言 2021-09-22 v2 人工智能

摘要

知识图谱已被证明在建模结构化信息与概念知识方面行之有效,尤其在医学领域。然而,高质量标注语料的缺乏仍是推进该任务研究与应用的关键问题。为加速医学领域特定知识图谱的研究,我们推出 DiaKG,一个高质量的糖尿病知识图谱中文数据集,共包含 22,050 个实体与 6,890 条关系。我们实现了近期典型的命名实体识别与关系抽取方法作为基准,以充分评估所提出的数据集。实证结果表明,DiaKG 对多数现有方法具有挑战性,并进行了进一步分析以探讨未来的改进研究方向。我们希望该数据集的发布能助力糖尿病知识图谱的构建并促进基于 AI 的应用。

关键词

引用

@article{arxiv.2105.15033,
  title  = {DiaKG: an Annotated Diabetes Dataset for Medical Knowledge Graph Construction},
  author = {Dejie Chang and Mosha Chen and Chaozhen Liu and Liping Liu and Dongdong Li and Wei Li and Fei Kong and Bangchang Liu and Xiaobin Luo and Ji Qi and Qiao Jin and Bin Xu},
  journal= {arXiv preprint arXiv:2105.15033},
  year   = {2021}
}

备注

CCKS2021