中文

学习推理中长度泛化的理论研究

人工智能 2024-04-02 v1

摘要

长度泛化(LG)是学习推理中的一个具有挑战性的问题。它指的是当在较小长度或规模的推理问题上进行训练时,所得模型在处理较大规模或长度的问题时表现困难的现象。尽管许多研究人员对 LG 进行了研究,但这一挑战依然存在。本文针对推理过程可建模为 DAG(有向无环图)的问题,对 LG 进行了理论研究。本文首先识别并证明了在学习推理中实现 LG 的条件。然后基于该理论设计了问题表示,使用 Transformer 学习解决奇偶性、加法和乘法等具有挑战性的推理问题,从而实现完美的 LG。

关键词

引用

@article{arxiv.2404.00560,
  title  = {A Theory for Length Generalization in Learning to Reason},
  author = {Changnan Xiao and Bing Liu},
  journal= {arXiv preprint arXiv:2404.00560},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2311.16173