biomedical知识发现的监督减少
人工智能
2025-04-15 v1 计算与语言
机器学习
摘要
知识发现受到 publication 数量不断增加以及大量标注数据稀缺的限制。为解决信息过载问题,必须采用自动化方法进行知识提取与处理。在监督程度与模型效果之间找到合适的平衡是一个重要挑战。虽然监督技术通常能获得更好的效果,但其主要缺点是需要标注数据。这一要求既费时又费力,且在探索新领域时难以实现可扩展性。针对这一挑战,本研究旨在在无结构文本中识别生物医学实体(如疾病、蛋白质)之间的语义关系,同时最大限度地减少对监督的依赖。我们引入一套基于依赖树和注意力机制的无监督算法,并采用多种点评二元分类方法。从弱监督转向完全无监督 setting,我们评估了这些方法在带有噪声标签数据上的学习能力。对生物医学基准数据集的评估探讨了这些方法的有效性。我们的方法解决了知识发现中的核心问题:在监督最小化的前提下实现性能与效果的平衡。通过逐步降低监督程度,我们评估了点评二元分类技术在处理噪声标签方面的鲁棒性,揭示了其从弱监督转向完全无监督情景的能力。全面的基准测试为这些技术的有效性提供了见解,表明朝向可适应知识发现系统的方向值得期待,代表了在标注数据有限时提取有用见解的数据高效方法的进展。
引用
@article{arxiv.2504.09582,
title = {Reduction of Supervision for Biomedical Knowledge Discovery},
author = {Christos Theodoropoulos and Andrei Catalin Coman and James Henderson and Marie-Francine Moens},
journal= {arXiv preprint arXiv:2504.09582},
year = {2025}
}
备注
Published as part of the PhD dissertation: Theodoropoulos, Christos, Marie-Francine Moens, and Matthew Blaschko. "Deep Learning Models for the Extraction of Knowledge from Text." (2025)