学习推理中长度泛化的理论研究
人工智能
2024-04-02 v1
摘要
长度泛化(LG)是学习推理中的一个具有挑战性的问题。它指的是当在较小长度或规模的推理问题上进行训练时,所得模型在处理较大规模或长度的问题时表现困难的现象。尽管许多研究人员对 LG 进行了研究,但这一挑战依然存在。本文针对推理过程可建模为 DAG(有向无环图)的问题,对 LG 进行了理论研究。本文首先识别并证明了在学习推理中实现 LG 的条件。然后基于该理论设计了问题表示,使用 Transformer 学习解决奇偶性、加法和乘法等具有挑战性的推理问题,从而实现完美的 LG。
关键词
引用
@article{arxiv.2404.00560,
title = {A Theory for Length Generalization in Learning to Reason},
author = {Changnan Xiao and Bing Liu},
journal= {arXiv preprint arXiv:2404.00560},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2311.16173