真实世界序列到序列任务中基于人类反馈的离线强化学习
计算与语言
2021-06-10 v3 机器学习
摘要
从部署在真实世界中的 NLP 系统可以收集到大量的交互日志。如何充分利用这些信息?在离线强化学习(RL)设定下使用此类交互日志是一种有前景的方法。然而,由于 NLP 任务的性质以及生产系统的约束,一系列挑战随之出现。我们简要概述这些挑战并讨论可能的解决方案。
引用
@article{arxiv.2011.02511,
title = {Offline Reinforcement Learning from Human Feedback in Real-World Sequence-to-Sequence Tasks},
author = {Julia Kreutzer and Stefan Riezler and Carolin Lawrence},
journal= {arXiv preprint arXiv:2011.02511},
year = {2021}
}
备注
5th Workshop on Structured Prediction for NLP at ACL 2021 Previously named "Learning from Human Feedback: Challenges for Real-World Reinforcement Learning in NLP" and presented at Challenges of Real-World RL Workshop at NeurIPS 2020