中文

Transformer 在稀疏恢复中的 In-Context 学习能力探讨

机器学习 2025-11-18 v3 人工智能

摘要

Transformer 的一个引人入目的特性是其能够进行 in-context learning(ICL),即 Transformer 能够在无需参数更新的情况下,根据提供的输入-输出演示对进行的上下文信息解决不同的推理任务。已证明 ICL 是通过 Transformer 执行梯度下降算法(Von Oswald 等,2023a;Bai 等,2024)实现的。本工作进一步表明,Transformer 能够执行学习到优化(L2O)算法。具体而言,对于 ICL 稀疏恢复(建模为 LASSO)任务,我们证明 K 层 Transformer 能够执行具有线性收敛速率 L2O 算法的 L2O 算法。这提供了一种新视角解释 Transformer 即使仅用几层即可实现卓越 ICL 能力的原因,而标准梯度下降算法则无法做到。此外,与传统 L2O 算法不同,这些算法要求训练时使用的测量矩阵与测试时使用的矩阵一致,而经过训练的 Transformer 能够解决使用不同测量矩阵生成的稀疏恢复问题。此外,作为 L2O 算法的 Transformer 可以利用训练任务中嵌入的结构信息加速其 ICL 中的收敛,并能够在 demonstration 对数不同长度上进行泛化,其中传统 L2O 算法通常难以应对或根本无法实现。这些理论发现得到我们的实验结果的支持。

关键词

引用

@article{arxiv.2410.13981,
  title  = {On the Learn-to-Optimize Capabilities of Transformers in In-Context Sparse Recovery},
  author = {Renpu Liu and Ruida Zhou and Cong Shen and Jing Yang},
  journal= {arXiv preprint arXiv:2410.13981},
  year   = {2025}
}