中文

面向文本驱动的生物医学图谱的图自监督学习对真实噪声的鲁棒性:案例研究

机器学习 2026-05-08 v1 人工智能

摘要

图自监督学习(GSSL)为无需标签数据即可学习图表示提供了强大的范式。然而,现有工作假设图谱干净且人工编辑。最近的自然语言处理进展使从文本中大规模自动提取知识图谱成为可能,为GSSL开辟了新机会,同时引入了大量真实噪声。这种噪声在现有鲁棒性研究中基本未被探讨,因为先前的鲁棒性研究通常依赖合成扰动。为填补这一空白,我们提出了第一个针对无监督术语类型标注的文本驱动图GSSL方法的全面评估。我们引入了噪声感知文本驱动图GSSL(NATD-GSSL),一个统一框架,集成了自动图构建、图谱细化和GSSL。我们的评估遵循双图协议,对比来自MedMentions的噪声图与干净的统一医学语言系统(UMLS)参考图,通过共享的黄金标准进行对齐。我们的结果揭示了在不同预文本任务和图神经网络(GNN)架构之间鲁棒性存在差异。关系重建对噪声高度敏感且受益于明确的模式定义,而特征重建则相当稳健,性能可与干净图设置相当。对比目标通常不受噪声影响,但强烈依赖与下游任务的对齐。GNN架构也起到了关键作用:双向关系消息传递设计更适用于噪声较大的文本驱动图,而单向关系消息传递在干净图上表现最佳。总体而言,NATD-GSSL为将GSSL应用于真实世界、噪声较大的图谱提供了实用指导,并实现了相对于预训练语言模型基线的最高可达7%的提升。所有代码和基准均 publicly available at https://github.com/OthmaneKabal/MC2GAE。

关键词

引用

@article{arxiv.2605.05463,
  title  = {Robustness of Graph Self-Supervised Learning to Real-World Noise: A Case Study on Text-Driven Biomedical Graphs},
  author = {Othmane Kabal and Mounira Harzallah and Fabrice Guillet and Hideaki Takeda and Ryutaro Ichise},
  journal= {arXiv preprint arXiv:2605.05463},
  year   = {2026}
}