面向机器学习的生物医学等价与包含本体匹配数据集
人工智能
2023-07-25 v8 机器学习
基因组学
摘要
本体匹配(OM)在生物信息学和语义网等诸多领域发挥着重要作用,其研究日益流行,尤其是随着机器学习(ML)技术的应用。尽管本体对齐评估倡议(OAEI)为 OM 系统的系统评估做出了令人瞩目的努力,但它仍存在若干局限,包括包含映射评估有限、参考映射次优,以及对基于 ML 的系统评估支持有限。为应对这些局限,我们引入了五个新的生物医学 OM 任务,涉及从 Mondo 和 UMLS 提取的本体。每个任务均包含等价匹配与包含匹配;参考映射的质量通过人工校订、本体剪枝等得以保证;并提出了一种综合评估框架,从多个角度衡量基于 ML 和非 ML 的 OM 系统的 OM 性能。我们报告了不同类型 OM 系统的评估结果,以展示这些资源的使用方式,它们均作为 OAEI 2022 新 BioML 赛道的一部分公开可用。
引用
@article{arxiv.2205.03447,
title = {Machine Learning-Friendly Biomedical Datasets for Equivalence and Subsumption Ontology Matching},
author = {Yuan He and Jiaoyan Chen and Hang Dong and Ernesto Jiménez-Ruiz and Ali Hadian and Ian Horrocks},
journal= {arXiv preprint arXiv:2205.03447},
year = {2023}
}
备注
Accepted paper (Best Resource Paper Candidate) in the 21st International Semantic Web Conference (ISWC-2022); Bio-ML Dataset: https://doi.org/10.5281/zenodo.6510086