利用反事实 LLM 推理增强强化学习安全性
机器学习
2024-09-17 v1
摘要
强化学习 (RL) 策略可能表现出不安全的行为,且难以解释。我们使用反事实大语言模型推理来增强 RL 策略训练后的安全性。我们表明,我们的方法改进并有助于解释 RL 策略的安全性。
引用
@article{arxiv.2409.10188,
title = {Enhancing RL Safety with Counterfactual LLM Reasoning},
author = {Dennis Gross and Helge Spieker},
journal= {arXiv preprint arXiv:2409.10188},
year = {2024}
}