有限样本下学习泛化能力的比较:Transformer 与 RNN 在吸引子动力学中的表现
计算与语言
2023-11-21 v1 机器学习
摘要
ChatGPT 作为广受认可的大语言模型(LLM),近期因其性能随规模提升而备受关注,这归因于其训练所使用的数十亿来自网络的自然语言句子。其底层架构 Transformer 已应用于包括视频、音频信号和机器人运动在内的多个领域。然而,这引发了一个关于 Transformer 学习泛化(GIL)能力的关键问题:ChatGPT 的成功主要归功于训练所用的大规模数据集,还是另有原因?为探究此问题,我们在涉及吸引子动力学学习的任务中,将 Transformer 的 GIL 能力与传统循环神经网络(RNN)进行了比较。在性能评估中,采用了动态时间规整(DTW)方法。我们的仿真结果表明,在有限数据可用条件下,Transformer 的 GIL 能力明显逊于 RNN。
引用
@article{arxiv.2311.10763,
title = {Comparing Generalization in Learning with Limited Numbers of Exemplars: Transformer vs. RNN in Attractor Dynamics},
author = {Rui Fukushima and Jun Tani},
journal= {arXiv preprint arXiv:2311.10763},
year = {2023}
}