中文

STEER:基于专家强化学习的统一风格迁移

计算与语言 2023-11-14 v1 人工智能

摘要

尽管文本风格迁移在自然语言处理中有诸多应用,但从单一源风格进行迁移的核心前提在真实场景中并不现实。在本文中,我们关注任意风格迁移:将文本从任意、未知的风格改写为目标风格。我们提出 STEER:基于专家强化学习的统一风格迁移(Unified Style Transfer with Expert Reinforcement),一个为克服风格迁移中并行数据有限这一挑战而开发的统一框架。STEER 在解码过程中利用专家乘积自动生成风格迁移配对语料。生成的离线数据随后用于预训练初始策略,之后再切换到在线、离策略强化学习,通过细粒度奖励信号进一步改进。STEER 是统一的,可从任意、未知的源风格迁移到多个目标风格,使其特别灵活高效。在包含来自多样化风格文本的挑战性数据集上的实验结果表明,与有竞争力的基线相比取得了最先进的结果。值得注意的是,尽管 STEER 的参数量小 226 倍,其在整体风格迁移质量上优于 175B 参数指令微调的 GPT-3。我们还表明 STEER 是鲁棒的,在域外数据上保持风格迁移能力,并在各种风格上超越几乎所有基线。我们方法的成功凸显了当 RL 算法辅以可控解码时,在克服有限数据监督挑战方面的潜力。

关键词

引用

@article{arxiv.2311.07167,
  title  = {STEER: Unified Style Transfer with Expert Reinforcement},
  author = {Skyler Hallinan and Faeze Brahman and Ximing Lu and Jaehun Jung and Sean Welleck and Yejin Choi},
  journal= {arXiv preprint arXiv:2311.07167},
  year   = {2023}
}

备注

for associated code, see https://github.com/shallinan1/STEERStyleTransfer