基于大模型的相似度驱动权重对 lifelong 强化学习
机器学习
2025-03-18 v1 社会与信息网络
摘要
顺序性任务是终身强化学习(Lifelong Reinforcement Learning, LRL)的重要应用前景,但仍面临诸多挑战。关键难点在于如何在动态环境中有效防止灾难性遗忘,同时促进知识迁移,维持可靠的决策性能。为此,我们提出了一种新框架 SDW(Similarity-Driven Weighting),该框架利用大型语言模型生成的动态函数精确控制训练过程。SDW 的核心在于两个由大型模型预生成的函数:任务相似度函数和权重计算函数。任务相似度函数从任务描述中提取多维特征,以定量衡量任务在状态、动作和奖励方面的相似性与差异性;权重计算函数则基于相似度信息动态生成关键训练参数,包括存储在回放缓冲区中旧任务数据的比例以及损失函数中的策略一致性权重,从而实现在学习新任务和迁移以前任务知识之间实现自适应平衡。通过在训练前离线生成函数代码,而非在训练过程中依赖大模型推理,SDW 框架降低了计算开销,同时在顺序任务场景中保持了效率。在 Atari 和 MiniHack 顺序任务上的实验结果表明,SDW 显著优于现有的终身强化学习方法。
引用
@article{arxiv.2503.12923,
title = {Lifelong Reinforcement Learning with Similarity-Driven Weighting by Large Models},
author = {Zhiyi Huang and Xiaohan Shan and Jianmin Li},
journal= {arXiv preprint arXiv:2503.12923},
year = {2025}
}