Transformer 在学习马尔可夫动力学函数中的最优性与 NP 困难性
机器学习
2025-11-19 v2 机器学习
摘要
由于上下文学习 (ICL),Transformer 架构能够基于给定提示中的输入-输出对解决未见任务。现有关于 ICL 的理论研究主要集中于线性回归任务,且通常假设输入为独立同分布 (i.i.d.)。为了理解 Transformer 在建模动力学驱动函数时如何表达 ICL,我们通过结构化的 ICL 设置研究了马尔可夫函数学习,其中我们刻画了损失景观以揭示潜在的优化行为。具体而言,我们 (1) 提供了单层线性自注意力 (LSA) 模型在(扩大的参数空间中)全局极小器的闭式表达;(2) 证明了恢复实现最优解的 Transformer 参数在一般情况下是 NP 困难的,揭示了单层 LSA 在表示结构化动力学函数方面的根本局限性;(3) 提供了多层 LSA 的一种新解释,即其执行预条件梯度下降以优化超出平方损失的多个目标。这些理论结果通过简化的 Transformer 进行了数值验证。
引用
@article{arxiv.2510.18638,
title = {Optimality and NP-Hardness of Transformers in Learning Markovian Dynamical Functions},
author = {Yanna Ding and Songtao Lu and Yingdong Lu and Tomasz Nowicki and Jianxi Gao},
journal= {arXiv preprint arXiv:2510.18638},
year = {2025}
}
备注
NeurIPS 2025