Transformer 中的 Superposition:构建 Mixture of Experts 的一种新方法
计算与语言
2025-01-08 v2 人工智能
摘要
在将大型语言模型 (LLM) 适应到新任务或领域时,持续性遗忘仍然是一个主要挑战。常规微调可能会覆盖现有知识,导致在原始任务上的性能下降。我们引入 Transformer 中的 Superposition(叠加),这是一种新型架构,利用自编码器在共享参数空间中叠加基础模型和微调模型的隐藏表示。通过使用基于 B-spline 的混合系数和自适应地根据输入数据分布重构隐藏状态的自编码器,我们的方法有效地缓解了持续性遗忘,实现了一种新的“模型内”叠加范式。该方法在保持原有模型能力的同时,允许添加紧凑的领域特定知识,并且支持在推理期间在模型状态之间进行动态切换。
关键词
引用
@article{arxiv.2501.00530,
title = {Superposition in Transformers: A Novel Way of Building Mixture of Experts},
author = {Ayoub Ben Chaliah and Hela Dellagi},
journal= {arXiv preprint arXiv:2501.00530},
year = {2025}
}