Fourier Head:帮助大语言模型学习复杂概率分布
机器学习
2025-03-12 v2 人工智能
计算与语言
机器学习
摘要
随着大语言模型质量的提高,人们越来越关注使用它们来建模非语言标记。例如,Decision Transformer 将智能体决策重新构建为一个序列建模问题,使用一个仅解码器的 LLM 来建模 Atari 智能体离散动作空间上的分布。然而,在将 LLM 适配到非语言领域时,目前尚不清楚离散区间上的 softmax 是否能捕捉到标记的连续结构以及高质量标记生成所需的潜在复杂分布。我们引入了一个使用傅里叶级数构建的神经网络层,如果我们希望输出具有更连续的结构,可以轻松地用该层替换任何线性层。我们在合成数据集以及大规模决策和时间序列预测任务上进行了广泛的分析。我们还提供了理论证据,表明该层可以更好地从数据中学习信号,同时忽略高频噪声。我们所有的结果都支持我们提出的 Fourier head 在底层数据分布具有自然连续结构的场景中的有效性。例如,Fourier head 将 Decision Transformer 智能体在四个基准 Atari 游戏中的回报提高了多达 377%,并将一个最先进的时间序列基础模型在 20 个训练期间未见过的基准上的预测性能提高了 3.5%。
引用
@article{arxiv.2410.22269,
title = {Fourier Head: Helping Large Language Models Learn Complex Probability Distributions},
author = {Nate Gillman and Daksh Aggarwal and Michael Freeman and Saurabh Singh and Chen Sun},
journal= {arXiv preprint arXiv:2410.22269},
year = {2025}
}
备注
Camera ready version (ICLR 2025). Code at https://nategillman.com/fourier-head