上下文内通用性就足够了吗?MLP 同样具有上下文内通用性
机器学习
2025-02-06 v1 机器学习
数值分析
神经与进化计算
数值分析
概率论
摘要
Transformer 的成功通常与其执行上下文内学习的能力有关。最近的研究表明,Transformer 在上下文内具有通用性,能够逼近任何关于上下文(一个在 上的概率测度)和查询 的实值连续函数。这引发了一个问题:上下文内通用性是否解释了它们相对于经典模型的优势?我们通过证明具有可训练激活函数的 MLP 同样具有上下文内通用性,对此给出了否定的答案。这表明 Transformer 的成功可能源于其他因素,如归纳偏置或训练稳定性。
引用
@article{arxiv.2502.03327,
title = {Is In-Context Universality Enough? MLPs are Also Universal In-Context},
author = {Anastasis Kratsios and Takashi Furuya},
journal= {arXiv preprint arXiv:2502.03327},
year = {2025}
}