中文

上下文内通用性就足够了吗?MLP 同样具有上下文内通用性

机器学习 2025-02-06 v1 机器学习 数值分析 神经与进化计算 数值分析 概率论

摘要

Transformer 的成功通常与其执行上下文内学习的能力有关。最近的研究表明,Transformer 在上下文内具有通用性,能够逼近任何关于上下文(一个在 XRd\mathcal{X}\subseteq \mathbb{R}^d 上的概率测度)和查询 xXx\in \mathcal{X} 的实值连续函数。这引发了一个问题:上下文内通用性是否解释了它们相对于经典模型的优势?我们通过证明具有可训练激活函数的 MLP 同样具有上下文内通用性,对此给出了否定的答案。这表明 Transformer 的成功可能源于其他因素,如归纳偏置或训练稳定性。

关键词

引用

@article{arxiv.2502.03327,
  title  = {Is In-Context Universality Enough? MLPs are Also Universal In-Context},
  author = {Anastasis Kratsios and Takashi Furuya},
  journal= {arXiv preprint arXiv:2502.03327},
  year   = {2025}
}