P2DT: 利用渐进提示决策 Transformer 缓解任务增量学习中的遗忘
机器学习
2025-09-04 v2 人工智能
摘要
灾难性遗忘对管理由大型模型控制的智能体构成了重大挑战,当这些智能体面对新任务时会导致性能下降。在我们的工作中,我们提出了一种新颖的解决方案——渐进提示决策 Transformer (P2DT)。该方法通过在新任务训练期间动态附加决策令牌来增强基于 Transformer 的模型,从而促进任务特定策略。我们的方法缓解了持续学习和离线强化学习场景中的遗忘问题。此外,P2DT 利用通过传统强化学习从所有任务中收集的轨迹,并在训练期间生成新的任务特定令牌,从而保留先前研究的知识。初步结果表明,我们的模型有效缓解了灾难性遗忘,并且随着任务环境的增加具有良好的可扩展性。
引用
@article{arxiv.2401.11666,
title = {P2DT: Mitigating Forgetting in task-incremental Learning with progressive prompt Decision Transformer},
author = {Zhiyuan Wang and Xiaoyang Qu and Jing Xiao and Bokui Chen and Jianzong Wang},
journal= {arXiv preprint arXiv:2401.11666},
year = {2025}
}
备注
Accepted by the 49th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)