中文

具有可学习核函数的线性 Transformer 是更优的上下文学习模型

机器学习 2024-06-06 v2 计算与语言

摘要

推进语言模型 (LMs) 次二次架构的前沿在快速发展的自然语言处理领域至关重要。包括状态空间模型在内的当前创新最初因在语言建模任务上超越 Transformer 性能而备受赞誉。然而,这些模型在关键的上下文学习 (In-Context Learning) 能力方面暴露出缺陷,而这正是 Transformer 传统上的优势领域。Based 模型作为一种混合解决方案应运而生,它结合了线性 Transformer 与受指数函数泰勒展开启发的核,并辅以卷积网络。镜像了 Transformer 的上下文适应能力,它成为该领域的有力竞争者。在我们的工作中,我们对 Based 核进行了单一而优雅的修改,增强了其上下文学习能力,这在多查询关联回忆任务和整体语言建模过程中得到了验证,并在 Pile 数据集上进行了演示。

关键词

引用

@article{arxiv.2402.10644,
  title  = {Linear Transformers with Learnable Kernel Functions are Better In-Context Models},
  author = {Yaroslav Aksenov and Nikita Balagansky and Sofia Maria Lo Cicero Vaina and Boris Shaposhnikov and Alexey Gorbatovski and Daniil Gavrilov},
  journal= {arXiv preprint arXiv:2402.10644},
  year   = {2024}
}