中文

为何敏感函数对 Transformer 而言难以学习?

机器学习 2024-05-28 v4

摘要

实证研究已识别出 Transformer 的一系列可学习性偏差与局限性,例如在学习计算简单形式语言(如 PARITY)时存在持续困难,以及对低阶函数的偏好。然而,理论理解仍然有限,现有的表达能力理论要么高估要么低估了实际的学习能力。我们证明,在 Transformer 架构下,损失景观受输入空间敏感性的约束:输出对输入字符串多个部分敏感的 Transformer 在参数空间中占据孤立点,从而导致泛化过程中的低敏感性偏差。我们从理论和实证两方面表明,该理论统一了关于 Transformer 学习能力和偏差的广泛实证观察,例如其对低敏感性和低阶的泛化偏差,以及在 PARITY 任务上的长度泛化困难。这表明,理解 Transformer 的归纳偏差不仅需要研究其原则上的表达能力,还需研究其损失景观。

关键词

引用

@article{arxiv.2402.09963,
  title  = {Why are Sensitive Functions Hard for Transformers?},
  author = {Michael Hahn and Mark Rofin},
  journal= {arXiv preprint arXiv:2402.09963},
  year   = {2024}
}

备注

ACL 2024