迈向具有社会与道德意识的强化学习智能体:基于大语言模型的奖励设计
人工智能
2024-06-03 v2
摘要
当我们设计并部署强化学习(RL)智能体时,奖励函数会激励智能体达成目标。对目标的不正确或不完整规范可能导致行为与人类价值观不一致——未能遵守那些模糊且依赖于情境的社会和道德规范,并引发不良后果,如负面副作用和不安全的探索。先前的工作通过手动定义奖励函数来避免负面副作用,利用人类监督进行安全探索,或使用基础模型作为规划工具。本工作研究如何利用大语言模型(LLM)对道德和社会规范的理解,来增强安全探索的强化学习方法。本工作根据人类反馈评估语言模型的结果,并展示了语言模型作为直接奖励信号的能力。
引用
@article{arxiv.2401.12459,
title = {Towards Socially and Morally Aware RL agent: Reward Design With LLM},
author = {Zhaoyue Wang},
journal= {arXiv preprint arXiv:2401.12459},
year = {2024}
}