NaRLE:基于情绪反馈强化学习的自然语言模型
计算与语言
2021-10-06 v1 机器学习
摘要
当前对话系统的研究集中于在任务导向或开放域设定下处理短对话的会话助手。在本文中,我们专注于在线改进基于任务的对话助手,主要是那些处理文档型对话(例如电子邮件)的助手,其内容可能与助手任务完全相关或无关。我们提出“NARLE”,一种深度强化学习(RL)框架,用于在线改进对话系统的自然语言理解(NLU)组件,而无需为客数据收集人工标注。所提出的方案将用户情绪与助手动作相关联,并利用其通过策略梯度改进 NLU 模型。针对两个意图分类问题,我们通过实验表明,使用强化学习微调预训练的监督学习模型可将性能提升高达 43%。此外,我们展示了该方法对部分且含噪的隐式反馈的鲁棒性。
引用
@article{arxiv.2110.02148,
title = {NaRLE: Natural Language Models using Reinforcement Learning with Emotion Feedback},
author = {Ruijie Zhou and Soham Deshmukh and Jeremiah Greer and Charles Lee},
journal= {arXiv preprint arXiv:2110.02148},
year = {2021}
}