中文

大语言模型用于长期任务训练:跨时限长度的实证研究

人工智能 2026-05-05 v1 机器学习

摘要

大型语言模型 (LLM) 已显示出作为通过环境交互序列解决任务的交互式代理的潜力。尽管 prior work 主要关注系统级优化或算法改进,但任务时限长度在塑造训练动力学中的作用仍不明确。本文提出了一项系统实证研究,通过受控任务构造来考察时限长度。具体而言,我们构建了受控任务,使得智能体面临相同的决策规则和推理结构,但仅在完成所需动作序列的长度上有所不同。我们的结果表明,仅增加时限长度本身就构成了训练瓶颈,由探索困难和信用分配挑战驱动,导致严重的训练不稳定。我们证明,时限缩减是解决这一限制的关键原则,通过稳定训练并在长时限任务中实现更好性能。此外,我们发现时限缩减与更强的跨时限长度泛化相关:在受缩减时限训练的模型在推理时能更有效地泛化到更长时限的变体,这一现象我们称为时限泛化。

关键词

引用

@article{arxiv.2605.02572,
  title  = {On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length},
  author = {Sunghwan Kim and Junhee Cho and Beong-woo Kwak and Taeyoon Kwon and Liang Wang and Nan Yang and Xingxing Zhang and Furu Wei and Jinyoung Yeo},
  journal= {arXiv preprint arXiv:2605.02572},
  year   = {2026}
}

备注

Accepted to ICML 2026