中文

基于信息引导强化学习策略的风格化对话生成

计算与语言 2020-04-07 v1

摘要

风格化回复生成对于构建用于工业应用的引人入胜的对话系统至关重要。尽管已引起大量研究兴趣,现有方法常以内容质量(相关性与流畅度)为代价来生成风格化回复。为更好地平衡内容质量与风格,我们引入一种称为信息引导强化学习(IG-RL)的新训练策略。在 IG-RL 中,训练模型被鼓励探索风格化表达,同时被约束以保持其内容质量。这是通过采用带统计风格信息引导的强化学习策略以实现保质探索来完成的。在两个数据集上的实验表明,所提方法在整体回复性能上优于若干强基线。

关键词

引用

@article{arxiv.2004.02202,
  title  = {Stylistic Dialogue Generation via Information-Guided Reinforcement Learning Strategy},
  author = {Yixuan Su and Deng Cai and Yan Wang and Simon Baker and Anna Korhonen and Nigel Collier and Xiaojiang Liu},
  journal= {arXiv preprint arXiv:2004.02202},
  year   = {2020}
}