中文

图Transformer在直推学习中的可压缩性理论

机器学习 2024-11-21 v1 机器学习

摘要

图上的直推任务与典型的监督机器学习任务有根本不同,因为样本之间不满足独立同分布假设。相反,所有训练/测试/验证样本在训练期间都存在,使其更类似于半监督任务。这些差异使得模型的分析与其他模型截然不同。最近,图Transformer通过克服长程依赖问题显著改善了这些数据集的结果。然而,完整Transformer的二次复杂度促使社区探索更高效的变体,例如具有更稀疏注意力模式的变体。虽然注意力矩阵已被广泛讨论,但网络的隐藏维度或宽度受到的关注较少。在这项工作中,我们建立了一些关于这些网络的隐藏维度如何以及在什么条件下可以被压缩的理论界限。我们的结果适用于图Transformer的稀疏和密集变体。

关键词

引用

@article{arxiv.2411.13028,
  title  = {A Theory for Compressibility of Graph Transformers for Transductive Learning},
  author = {Hamed Shirzad and Honghao Lin and Ameya Velingker and Balaji Venkatachalam and David Woodruff and Danica Sutherland},
  journal= {arXiv preprint arXiv:2411.13028},
  year   = {2024}
}