推理即周期性?通过有效周期性建模提升大语言模型
计算与语言
2025-10-28 v4 人工智能
机器学习
摘要
周期性作为最重要的基本特征之一,为人类学习范式中的结构化知识获取与系统性认知过程奠定了基础。然而,Transformer 中周期性建模的潜在缺陷影响了基于其构建的大语言模型(LLM)的学习效率与底层原理的建立。本文证明,集成有效的周期性建模可以提升 LLM 的学习效率与性能。我们引入 FANformer,通过修改注意力机制的特征投影过程,将傅里叶分析网络(FAN)适配到注意力机制中,以实现高效的周期性建模。大量语言建模实验结果表明,FANformer 在模型规模和训练 token 扩展时始终优于 Transformer,凸显其优越的学习效率。我们的预训练 FANformer-1B 在下游任务上相比具有相似模型参数或训练 token 的开源 LLM 表现出显著提升。此外,我们揭示 FANformer 相比 Transformer 具有更强的学习和应用规则进行推理的能力。结果使 FANformer 成为推进 LLM 的有效且有前景的架构。
引用
@article{arxiv.2502.21309,
title = {Reasoning is Periodicity? Improving Large Language Models Through Effective Periodicity Modeling},
author = {Yihong Dong and Ge Li and Xue Jiang and Yongding Tao and Kechi Zhang and Hao Zhu and Huanyu Liu and Jiazheng Ding and Jia Li and Jinliang Deng and Hong Mei},
journal= {arXiv preprint arXiv:2502.21309},
year = {2025}
}
备注
Accepted to NeurIPS'25