中文

SYNAPSE-G:桥接大语言模型与图学习用于罕见事件分类

机器学习 2025-08-14 v1

摘要

标记数据的稀缺性,尤其是对于罕见事件,阻碍了有效机器学习模型的训练。本文提出了 SYNAPSE-G(通过图扩展进行正采样的合成增强),这是一种利用大语言模型(LLM)为罕见事件分类生成合成训练数据的新颖流程,旨在解决冷启动问题。这些合成数据作为种子,用于在种子与大型未标记数据集之间构建的相似性图上进行半监督标签传播。这能识别出候选正例,随后由预言机(人类或 LLM)进行标记。扩展后的数据集随后用于训练/微调分类器。我们从理论上分析了合成数据的质量(有效性和多样性)如何影响我们方法的精确率和召回率。在不平衡的 SST2 和 MHS 数据集上的实验证明了 SYNAPSE-G 在寻找正标签方面的有效性,其性能优于包括最近邻搜索在内的基线方法。

关键词

引用

@article{arxiv.2508.09544,
  title  = {SYNAPSE-G: Bridging Large Language Models and Graph Learning for Rare Event Classification},
  author = {Sasan Tavakkol and Lin Chen and Max Springer and Abigail Schantz and Blaž Bratanič and Vincent Cohen-Addad and MohammadHossein Bateni},
  journal= {arXiv preprint arXiv:2508.09544},
  year   = {2025}
}