中文

失踪的分词:图分词用于 Transformer 中的根本性权衡

机器学习 2026-05-22 v1

摘要

Transformer 已成为图学习的核心架构,但其应用于图形问题首先需要选择分词方式:即图到标记的映射,决定输入层暴露哪些结构信息。在本工作中,我们展示了这一选择是 Transformer 可表达性的基本组成部分。我们检验了三种作为许多现有图分词构建块的分词方式:谱分词、随机漫步分词和邻接矩阵分词。我们证明,不同的分词会诱导不同的深度范式:相同的图计算可能在一种分词下通过浅层 Transformer 实现,而在另一种分词下则需要显著更大的深度。例如,我们证明随机漫步分词对于任意步长都是有损的,无法一般情况下从中恢复图的完整信息;而谱分词则是无损的,但在局部任务方面条件不佳。我们进一步表明,尽管随机漫步和谱分词都源于邻接信息,但对于受限深度的 Transformer 来说,无法在一般情况下在分词族之间进行转换。特别是,我们建立了下界和不可能性结果,表明不利的分词可能阻碍对更合适结构表示的有效恢复。最后,我们通过合成数据和真实任务上的控制实验补充理论,验证了预测的分离效应,表明不同任务偏好不同结构视图,组合互补分词可让 Transformer 从每种表示中利用不同信号。

关键词

引用

@article{arxiv.2605.22471,
  title  = {Lost in Tokenization: Fundamental Trade-offs in Graph Tokenization for Transformers},
  author = {Maya Bechler-Speicher and Gilad Yehudai and Gil Harari and Clayton Sanford and Amir Globerson and Joan Bruna},
  journal= {arXiv preprint arXiv:2605.22471},
  year   = {2026}
}