中文

延迟瓶颈: alleviating pre-trained graph neural networks 中的遗忘现象

机器学习 2024-04-24 v1 人工智能

摘要

对图神经网络进行预训练以提取可迁移的知识并应用于下游任务已成为图表示学习事实标准。近期研究聚焦于设计自监督预训练任务,从大规模无标签数据中提取有用且通用的可迁移知识。然而,这些方法面临一个不可避免的问题:传统预训练策略旨在提取有关预训练任务的有用信息,可能无法提取所有有关下游任务的有用信息。本文从信息瓶颈(IB)的角度重新审视传统预训练和微调框架中的预训练过程,并确认预训练阶段的遗忘现象可能对下游任务产生不利影响。因此,我们提出一种新的延迟瓶颈预训练(DBP)框架,通过抑制压缩操作在预训练阶段维持尽可能多的潜在表示与训练数据之间的互信息,并将压缩操作延迟至微调阶段,以确保压缩能够由带标签的微调数据和下游任务引导。为实现此目标,我们设计两个可直接优化的信息控制目标,并将其集成到实际模型设计中。在化学和生物学领域的大量实验表明,DBP 的有效性。

关键词

引用

@article{arxiv.2404.14941,
  title  = {Delayed Bottlenecking: Alleviating Forgetting in Pre-trained Graph Neural Networks},
  author = {Zhe Zhao and Pengkun Wang and Xu Wang and Haibin Wen and Xiaolong Xie and Zhengyang Zhou and Qingfu Zhang and Yang Wang},
  journal= {arXiv preprint arXiv:2404.14941},
  year   = {2024}
}