CoFrGeNet:基于continued fraction 架构的语言生成
计算与语言
2026-05-25 v4 人工智能
摘要
Transformer 算法或许是语言生成的首选架构。本文灵感来自连分数,我们提出了一种新的函数类用于生成模型。实现该函数类的架构家族命名为 CoFrGeNet - Continued Fraction Generative Networks。我们基于该函数类设计了 novel 架构组件,可取代 Transformer 块中的 Multi-head Attention 和 Feed-Forward Networks,从而大幅降低参数数量。我们推导了自定义梯度公式,以较使用标准 PyTorch 梯度更准确、更高效地优化所提组件。我们的组件是即插即用式的替换,仅需对已建立的 Transformer 模型训练或推理程序进行少量更改,使其易于集成到大型工业工作流程中。我们在两个截然不同的 transformer 架构 GPT2-xl (15B 参数) 和 Llama3 (32B 参数) 上进行实验,其中前者我们在 OpenWebText 和 GneissWeb 上进行预训练,后者我们在由九个不同数据集组成的 docling 数据混合集合上进行预训练。结果表明,我们所构建模型在下游分类、Q&A、推理和文本理解任务上的性能与原始模型相当,甚至在部分任务中表现更好,同时参数数量仅为原始模型的 至 ,且预训练时间更短。我们认为,未来针对硬件定制的实现将进一步发掘该架构的真正潜力。
引用
@article{arxiv.2601.21766,
title = {CoFrGeNet: Continued Fraction Architectures for Language Generation},
author = {Amit Dhurandhar and Vijil Chenthamarakshan and Dennis Wei and Tejaswini Pedapati and Karthikeyan Natesan Ramamurthy and Rahul Nair},
journal= {arXiv preprint arXiv:2601.21766},
year = {2026}
}
备注
Earlier version accepted to ICML 2026