中文

定制模型能否在上下文中学习?关于混合架构在上下文学习任务中的表现探索

机器学习 2024-11-07 v1 人工智能

摘要

上下文学习(ICL)是一种通过提示序列来完成任务学习的现象,无需参数更新。在具有绝对位置嵌入的多头注意(MHA)结构中,ICL 受到的关注度超过其他序列模型变体。我们考察了 GPT-2 与 LLaMa 以及 LLaMa 与 Mamba 之间的架构差异。我们延续了 Garg 等人(2022)和 Park 等人(2024)的工作,研究了 GPT-2/LLaMa 混合模型和 LLaMa/Mamba 混合模型——探讨序列转换块与上下文中表现之间的相互作用。我们指出,某些架构变化会导致训练效率/ICL 准确率下降,因而收敛到次优预测器或收敛速度更慢。我们还发现某些混合模型表现出乐观的性能提升,为未来的 ICL 重点架构修改提供了灵感。此外,我们提出了“ICL 回归得分”,用于描述模型在特定任务上的整体性能。由于计算限制,我们的研究受到架构空间、训练时长、训练运行次数、函数类复杂度和基准复杂度的限制。为促进可重复且可扩展的研究,我们提供了一个类型化、模块化和可扩展的 Python 软件包,上述所有实验均在其上进行。

关键词

引用

@article{arxiv.2411.03945,
  title  = {Can Custom Models Learn In-Context? An Exploration of Hybrid Architecture Performance on In-Context Learning Tasks},
  author = {Ryan Campbell and Nelson Lojo and Kesava Viswanadha and Christoffer Grondal Tryggestad and Derrick Han Sun and Sriteja Vijapurapu and August Rolfsen and Anant Sahai},
  journal= {arXiv preprint arXiv:2411.03945},
  year   = {2024}
}

备注

18 pages, 16 figures