中文

$\mathrm{E^{2}CFD}$:通过大语言模型实现有效且高效的安全强化学习代价函数设计

机器学习 2024-07-09 v1 人工智能

摘要

不同类别的安全强化学习算法已在各种类型的安全需求场景中显示出令人满意的性能。然而,现有方法主要解决一类或几类特定的安全需求场景问题,无法应用于任意的安全需求场景。此外,现有强化学习算法的优化目标与任务需求不一致。基于解决这些问题的需要,我们提出了E2CFD\mathrm{E^{2}CFD},一个有效且高效的代价函数设计框架。E2CFD\mathrm{E^{2}CFD}利用大语言模型(LLM)的能力来理解各种安全场景并生成相应的代价函数。它结合了快速性能评估(FPE)方法,以促进对生成的代价函数进行快速迭代更新。通过这一迭代过程,E2CFD\mathrm{E^{2}CFD}旨在为安全场景中的特定任务获得最适合策略训练的代价函数。实验证明,使用该框架训练的策略的性能优于传统的安全强化学习算法以及使用精心设计的代价函数训练的策略。

关键词

引用

@article{arxiv.2407.05580,
  title  = {$\mathrm{E^{2}CFD}$: Towards Effective and Efficient Cost Function Design for Safe Reinforcement Learning via Large Language Model},
  author = {Zepeng Wang and Chao Ma and Linjiang Zhou and Libing Wu and Lei Yang and Xiaochuan Shi and Guojun Peng},
  journal= {arXiv preprint arXiv:2407.05580},
  year   = {2024}
}