中文

基于图的多模态学习用于疾病关系抽取

机器学习 2022-09-01 v2 人工智能 计算与语言 社会与信息网络

摘要

目的:疾病知识图谱是一种连接、组织并访问关于疾病的异构信息的方式,对人工智能(AI)具有诸多益处。为构建知识图谱,有必要以疾病概念间关系的形式从多模态数据集中抽取知识,并对概念和关系类型进行归一化。方法:我们提出REMAP,一种用于疾病关系抽取与分类的多模态方法。REMAP机器学习方法将一个部分、不完整的知识图谱和一个医学语言数据集联合嵌入到一个紧凑的潜在向量空间中,随后对齐多模态嵌入以实现最优的疾病关系抽取。结果:我们将REMAP应用于一个包含96,913条关系的疾病知识图谱和一个含124万句句子的文本数据集。在由人类专家标注的数据集上,REMAP通过融合疾病知识图谱与文本信息,将基于文本的疾病关系抽取的准确率提升10.0%、F1分数提升17.2%。此外,REMAP利用文本信息推荐知识图谱中的新关系,在准确率上超越基于图的方法8.4%、在F1分数上超越10.4%。结论:REMAP是一种通过融合结构化知识与文本信息来抽取和分类疾病关系的多模态方法。REMAP提供了一种灵活的神经架构,可便捷地发现、访问并验证AI驱动的疾病概念间关系。

关键词

引用

@article{arxiv.2203.08893,
  title  = {Multimodal Learning on Graphs for Disease Relation Extraction},
  author = {Yucong Lin and Keming Lu and Sheng Yu and Tianxi Cai and Marinka Zitnik},
  journal= {arXiv preprint arXiv:2203.08893},
  year   = {2022}
}