图基座模型提取攻击的系统性研究
机器学习
2025-11-18 v1 密码学与安全
摘要
图机器学习在链接预测、异常检测和节点分类等任务中取得了快速进展。随着模型规模扩大,预训练图模型因编码了大量计算和领域专长而成为珍贵的知识资产。基于这些进展,图基座模型(GFMs)通过在大规模且多样化的数据上联合预训练图和文本编码器实现了重大突破。这统一了结构和语义理解,实现零样例推理,并支持欺诈检测和生物医学分析等应用。然而,高昂的预训练成本和广泛的跨域知识也使GFMs成为模型提取攻击(MEAs)的有力目标。先前工作仅关注在单个图上训练的小型图神经网络,留下了针对大规模和多模态GFMs的安全隐含问题鲜有探讨。本文首次系统性地研究了针对GFMs的MEAs。我们形式化了一个黑箱威胁模型,定义六个实际攻击场景,涵盖领域层面和图特有的提取目标、架构不匹配、有限查询预算、部分节点访问和训练数据差异。为实现这些攻击,我们引入一种轻量级提取方法,通过监督回归图嵌入来训练攻击者编码器。即使没有对比预训练数据,该方法仍能学习到与受害者文本编码器对齐的编码器,保留其在未见图上的零样例推理能力。在七个数据集上的实验表明,攻击者仅需占原训练成本极小比例即可逼近受害者模型,几乎不损失准确率。这一发现表明GFMs大幅扩大了MEA攻击面,凸显了在大规模图学习系统中需要针对部署情况考虑的安全防御。
引用
@article{arxiv.2511.11912,
title = {A Systematic Study of Model Extraction Attacks on Graph Foundation Models},
author = {Haoyan Xu and Ruizhi Qian and Jiate Li and Yushun Dong and Minghao Lin and Hanson Yan and Zhengtao Yao and Qinghua Liu and Junhao Dong and Ruopeng Huang and Yue Zhao and Mengyuan Li},
journal= {arXiv preprint arXiv:2511.11912},
year = {2025}
}