中文

Hound:针对文本标注图的少样本和零样本节点分类的监督信号探测

人工智能 2024-09-04 v1 计算与语言 信息检索

摘要

文本标注图 (TAG) 是一种具有每个节点文本描述的图结构数据。在 TAG 上进行少样本和零样本节点分类在学术和社交网络等领域具有广泛应用前景。然而,这两个任务都面临监督信号稀缺的挑战,现有方法仅利用对比损失对齐基于图的节点嵌入和基于语言的文本嵌入。在本文中,我们提出 Hound 通过引入更多监督信号来提高准确率,其核心思想是超越数据中提供的节点-文本配对。具体而言,我们设计了三种数据增强技术,即节点扰动、文本匹配和语义否定,为每个文本提供更多参考节点,反之亦然。节点扰动通过添加/删除边来产生多样化的节点嵌入,以便与文本匹配。文本匹配检索相似嵌入的文本以匹配节点。语义否定使用负提示构建语义相反的负文本,对照原始节点和文本。我们在 5 个数据集上对 Hound 进行评估,并与 13 种最新基线方法进行比较。结果表明,Hound 在所有基线上均表现出色,其准确率提升通常超过 5%。

关键词

引用

@article{arxiv.2409.00727,
  title  = {Hound: Hunting Supervision Signals for Few and Zero Shot Node Classification on Text-attributed Graph},
  author = {Yuxiang Wang and Xiao Yan and Shiyu Jin and Quanqing Xu and Chuanhui Yang and Yuanyuan Zhu and Chuang Hu and Bo Du and Jiawei Jiang},
  journal= {arXiv preprint arXiv:2409.00727},
  year   = {2024}
}