Distil-xLSTM:通过循环结构学习注意力机制
机器学习
2025-03-25 v1 人工智能
计算与语言
摘要
当前的自然语言处理 (NLP) 时代由 Transformer 模型主导。然而,依赖于循环机制的新架构,如 xLSTM 和 Mamba,已被提出作为基于注意力的模型的替代方案。尽管计算方式与注意力机制不同,这些循环模型仍取得了良好的结果,有时甚至优于最先进的基于注意力的模型。在本工作中,我们提出了 Distil-xLSTM,这是一种基于 xLSTM 的小型语言模型 (SLM),通过从大型语言模型 (LLM) 中蒸馏知识进行训练,在保持计算和规模效率的同时展现出可喜的结果。我们的 Distil-xLSTM 专注于利用其循环序列混合组件来逼近基于 Transformer 的模型的注意力参数化,并在极少的训练下取得了良好的结果。
引用
@article{arxiv.2503.18565,
title = {Distil-xLSTM: Learning Attention Mechanisms through Recurrent Structures},
author = {Abdoul Majid O. Thiombiano and Brahim Hnich and Ali Ben Mrad and Mohamed Wiem Mkaouer},
journal= {arXiv preprint arXiv:2503.18565},
year = {2025}
}