中文

利用反事实 LLM 推理增强强化学习安全性

机器学习 2024-09-17 v1

摘要

强化学习 (RL) 策略可能表现出不安全的行为,且难以解释。我们使用反事实大语言模型推理来增强 RL 策略训练后的安全性。我们表明,我们的方法改进并有助于解释 RL 策略的安全性。

关键词

引用

@article{arxiv.2409.10188,
  title  = {Enhancing RL Safety with Counterfactual LLM Reasoning},
  author = {Dennis Gross and Helge Spieker},
  journal= {arXiv preprint arXiv:2409.10188},
  year   = {2024}
}