中文

从奖励塑形到 Q-塑形:利用 LLM 指导的知识实现无偏学习

人工智能 2024-10-03 v1 机器学习

摘要

Q-塑形是 Q 值初始化的扩展,作为奖励塑形的替代方案,用于将领域知识纳入以加速智能体训练,从而通过直接塑形 Q 值来提高样本效率。该方法在 diverse 任务上都通用且稳健,允许立即进行影响评估并保证最优性。我们在使用大语言模型(LLM)作为启发式提供者的 20 个不同环境中评估了 Q-塑形。结果表明,Q-塑形显著提高了样本效率,在每个环境中相对于最佳基线实现了 \textbf{16.87\%} 的提升,相对于基于 LLM 的奖励塑形方法实现了 \textbf{253.80\%} 的提升。这些发现确立了 Q-塑形作为强于常规奖励塑形的无偏替代方案。

关键词

引用

@article{arxiv.2410.01458,
  title  = {From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge},
  author = {Xiefeng Wu},
  journal= {arXiv preprint arXiv:2410.01458},
  year   = {2024}
}

备注

q-shaping, reinforcement learning, reward shaping