CoRTEx:通过解释的对比学习进行术语表示及其在构建生物医学知识图谱中的应用
计算与语言
2023-12-14 v1
摘要
目标:生物医学知识图谱在众多生物医学研究领域中发挥着关键作用。同时,术语聚类作为构建这些知识图谱的关键步骤,旨在识别同义术语。由于知识匮乏,先前使用统一医学语言系统(UMLS)同义词训练的对比学习模型难以对困难术语进行聚类,且泛化能力局限于UMLS术语。在本工作中,我们利用大型语言模型(LLM)中的世界知识,提出通过解释的对比学习进行术语表示(CoRTEx),以增强术语表示并显著改善术语聚类。材料与方法:模型训练涉及使用ChatGPT为清洗后的UMLS术语子集生成解释。我们采用对比学习,同时考虑术语和解释的嵌入,并逐步引入困难负样本。此外,设计了一种ChatGPT辅助的BIRCH算法,用于新本体的高效聚类。结果:我们建立了一个聚类测试集和一个困难负样本测试集,我们的模型在这两个测试集上均持续取得最高的F1分数。利用CoRTEx嵌入和改进的BIRCH算法,我们将来自生物医学信息学本体系统(BIOS)的35,580,932个术语归入22,104,559个聚类,仅需对ChatGPT进行O(N)次查询。案例研究凸显了该模型在解释信息的辅助下处理挑战性样本的有效性。结论:通过将术语与其解释对齐,CoRTEx展现出优于基准模型的准确性和超越其训练集的鲁棒性,并且适用于大规模生物医学本体的术语聚类。
引用
@article{arxiv.2312.08036,
title = {CoRTEx: Contrastive Learning for Representing Terms via Explanations with Applications on Constructing Biomedical Knowledge Graphs},
author = {Huaiyuan Ying and Zhengyun Zhao and Yang Zhao and Sihang Zeng and Sheng Yu},
journal= {arXiv preprint arXiv:2312.08036},
year = {2023}
}