中文

用于可控文本生成的评论家引导解码

计算与语言 2022-12-22 v1

摘要

将语言生成引导至特定目标或远离不期望内容,一直是使用语言模型(LM)的长期目标。近期工作表明强化学习与加权解码可作为实现更高程度语言控制与质量的有效途径,各有优劣。本文提出一种用于可控语言生成的新型评论家解码方法(CriticControl),它结合了强化学习与加权解码的优势。具体而言,我们采用 actor-critic 框架,从不可微奖励模型中训练一个 LM 引导评论家。与加权解码类似,我们的方法冻结语言模型,并利用所称的评论家操纵输出词元分布,从而提升训练效率与稳定性。在主题控制、情感控制和去毒化三个可控生成任务上的评测表明,相比先前方法,我们的方法生成了更连贯且受控性更好的文本。此外,CriticControl 在零样本设定下展现出优越的泛化能力。人工评估研究也佐证了我们的发现。

关键词

引用

@article{arxiv.2212.10938,
  title  = {Critic-Guided Decoding for Controlled Text Generation},
  author = {Minbeom Kim and Hwanhee Lee and Kang Min Yoo and Joonsuk Park and Hwaran Lee and Kyomin Jung},
  journal= {arXiv preprint arXiv:2212.10938},
  year   = {2022}
}

备注

11 pages, 6 figures