从奖励塑形到 Q-塑形:利用 LLM 指导的知识实现无偏学习
人工智能
2024-10-03 v1 机器学习
摘要
Q-塑形是 Q 值初始化的扩展,作为奖励塑形的替代方案,用于将领域知识纳入以加速智能体训练,从而通过直接塑形 Q 值来提高样本效率。该方法在 diverse 任务上都通用且稳健,允许立即进行影响评估并保证最优性。我们在使用大语言模型(LLM)作为启发式提供者的 20 个不同环境中评估了 Q-塑形。结果表明,Q-塑形显著提高了样本效率,在每个环境中相对于最佳基线实现了 \textbf{16.87\%} 的提升,相对于基于 LLM 的奖励塑形方法实现了 \textbf{253.80\%} 的提升。这些发现确立了 Q-塑形作为强于常规奖励塑形的无偏替代方案。
引用
@article{arxiv.2410.01458,
title = {From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge},
author = {Xiefeng Wu},
journal= {arXiv preprint arXiv:2410.01458},
year = {2024}
}
备注
q-shaping, reinforcement learning, reward shaping