变压器学习隐含马尔可夫模型的局限性
机器学习
2024-06-07 v1 人工智能
摘要
尽管变压器架构在自然语言处理、计算机视觉和机器人等各种序列建模任务中取得了显著成功,但其学习基本序列模型(如隐含马尔可夫模型HMM)的能力仍不明确。本文通过大量实验探讨变压器在学习HMM及其变体方面的性能,并与循环神经网络(RNN)进行比较。我们发现,在所有测试的HMM模型中,变压器在训练速度和测试准确率上始终低于RNN。甚至存在一些具有挑战性的HMM实例,变压器难以学习,而RNN能够成功实现。我们的实验进一步揭示了变压器的深度与其能有效学习的最长序列长度之间的关系,这取决于HMM的类型和复杂度。为解决变压器在建模HMM方面的局限,本文演示了一种称为的链式思考(Chain-of-Thought)变体,可在训练阶段帮助变压器降低评估误差并学习更长的序列,代价是增加训练时间。最后,我们通过理论结果证明了变压器在以对数深度逼近HMM的表达能力。
引用
@article{arxiv.2406.04089,
title = {On Limitation of Transformer for Learning HMMs},
author = {Jiachen Hu and Qinghua Liu and Chi Jin},
journal= {arXiv preprint arXiv:2406.04089},
year = {2024}
}