中文

探索类内学习:任务复杂度与模型架构对泛化与效率的影响

机器学习 2025-05-13 v1

摘要

我们通过严谨的实验框架系统性地变异任务复杂度和模型架构,对类内学习 (ICL) 进行探究。超越线性回归基线,我们引入高斯核回归和非线性动力系统任务,强调时间和递归推理。我们评估了四种不同的模型:GPT2 风格的 Transformer、带有 FlashAttention 机制的 Transformer、基于卷积的 Hyena 模型,以及 Mamba 状态空间模型。每个模型都在合成数据集上从头训练,并在测试时评估其泛化能力。我们的发现表明,模型架构显著影响 ICL 的性能。标准 Transformer 在多样化任务上表现稳健,而 Mamba 在时序结构动力学方面表现出色。Hyena 有效捕捉长程依赖,但在训练早期表现出更高的方差,FlashAttention 在计算效率方面提供优势,但在低数据 regime 中更为敏感。进一步的分析揭示了高斯核任务中局部性导致的捷径、通过输入范围缩放实现的非线性可分性提升,以及掌握高维任务中课程学习的关键作用。

关键词

引用

@article{arxiv.2505.06475,
  title  = {Probing In-Context Learning: Impact of Task Complexity and Model Architecture on Generalization and Efficiency},
  author = {Binwen Liu and Peiyu Xu and Quan Yuan and Yihong Chen},
  journal= {arXiv preprint arXiv:2505.06475},
  year   = {2025}
}