轨迹约束智能体的课程设计:压缩 LLM 中的思维链 Token
机器学习
2025-11-05 v1
摘要
训练智能体在部署期间严格约束下运行,例如有限的资源预算或严格的安全要求,带来了重大挑战,尤其是当这些约束使任务变得复杂时。在本工作中,我们提出了一种课程学习策略,在训练过程中逐步收紧约束,使智能体能够逐步掌握部署要求。受无约束强化学习(RL)中自步学习技术的启发,我们的方法通过最初在简化版本的约束上进行训练,并逐步引入完整的部署条件,从而促进向具有挑战性的环境更平滑地过渡。我们使用二叉树马尔可夫决策过程(MDP)中的 RL 智能体进行了理论分析,证明与从一开始就施加轨迹约束的基线方法相比,我们的课程策略可以加速训练。此外,我们在多种设置下实证验证了该方法在 RL 和大语言模型(LLM)智能体中的有效性与通用性,包括二叉树 MDP、多任务导航领域以及具有两个基准测试的数学推理任务。这些结果突显了课程设计在提升部署期间受复杂轨迹约束的智能体的效率与性能方面的潜力。此外,当应用于 LLM 时,我们的策略能够压缩输出的思维链 token,在消费级硬件上实现显著的推理加速,证明了其在资源受限部署中的有效性。
引用
@article{arxiv.2511.02690,
title = {Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs},
author = {Georgios Tzannetos and Parameswaran Kamalaruban and Adish Singla},
journal= {arXiv preprint arXiv:2511.02690},
year = {2025}
}
备注
NeurIPS'25 paper