面向长时程互动的内在信用分配
机器学习
2026-02-16 v1 人工智能
摘要
我们如何训练智能体在长时程不确定性中导航?本文提出了 {\Delta}Belief-RL 方法,利用语言模型自身的内在信念来奖励中间进展。该方法利用智能体对目标解决方案概率变化进行信用分配。通过在合成互动数据上训练,{\Delta}Belief-RL 教授的信息寻求能力持续优于纯结果导向奖励的强化学习方法,在客户服务和个性化等超出分布的应用中实现改进。值得注意的是,随着测试时互动超过训练时程的扩展,性能持续提升,互动效率在 Pass@k 指标上也随之提高。总体而言,我们的工作引入了一种可扩展的训练策略,通过内在 {\Delta}Belief 奖励实现对中间动作的信用分配,从而在面向长时程不确定性的导航中发挥作用。
引用
@article{arxiv.2602.12342,
title = {Intrinsic Credit Assignment for Long Horizon Interaction},
author = {Ilze Amanda Auzina and Joschka Strüber and Sergio Hernández-Gutiérrez and Shashwat Goel and Ameya Prabhu and Matthias Bethge},
journal= {arXiv preprint arXiv:2602.12342},
year = {2026}
}
备注
9 pages, 12 figures