中文

真实世界序列到序列任务中基于人类反馈的离线强化学习

计算与语言 2021-06-10 v3 机器学习

摘要

从部署在真实世界中的 NLP 系统可以收集到大量的交互日志。如何充分利用这些信息?在离线强化学习(RL)设定下使用此类交互日志是一种有前景的方法。然而,由于 NLP 任务的性质以及生产系统的约束,一系列挑战随之出现。我们简要概述这些挑战并讨论可能的解决方案。

关键词

引用

@article{arxiv.2011.02511,
  title  = {Offline Reinforcement Learning from Human Feedback in Real-World Sequence-to-Sequence Tasks},
  author = {Julia Kreutzer and Stefan Riezler and Carolin Lawrence},
  journal= {arXiv preprint arXiv:2011.02511},
  year   = {2021}
}

备注

5th Workshop on Structured Prediction for NLP at ACL 2021 Previously named "Learning from Human Feedback: Challenges for Real-World Reinforcement Learning in NLP" and presented at Challenges of Real-World RL Workshop at NeurIPS 2020