仅靠反馈就足够了吗?在目标条件强化学习中利用自然语言反馈
计算与语言
2023-12-11 v1 人工智能
摘要
尽管取得了诸多成功,强化学习(RL)领域在匹配人类行为学习令人印象深刻的泛化能力方面仍相去甚远。弥合这一差距的一种可能途径是为 RL 智能体提供更丰富、更类人的自然语言反馈。为了研究这一想法,我们首先扩展了 BabyAI,使其能够根据环境动态和目标条件成功自动生成语言反馈。然后,我们修改了 Decision Transformer 架构以利用这一额外信号。我们发现,使用语言反馈进行训练(无论是替代还是补充 return-to-go 或目标描述)都能提高智能体的泛化性能,并且即使反馈仅在训练期间可用而在推理时不可用,智能体也能从中受益。
引用
@article{arxiv.2312.04736,
title = {Is Feedback All You Need? Leveraging Natural Language Feedback in Goal-Conditioned Reinforcement Learning},
author = {Sabrina McCallum and Max Taylor-Davies and Stefano V. Albrecht and Alessandro Suglia},
journal= {arXiv preprint arXiv:2312.04736},
year = {2023}
}
备注
Accepted at Workshop on Goal-conditioned Reinforcement Learning, NeurIPS 2023