中文

用于多风格可控生成的动态多奖励加权

计算与语言 2025-07-22 v3

摘要

文本风格表达了多样化的信息,包括人际动态(例如正式程度)和作者的情绪或态度(例如厌恶)。一个开放性的问题是:如何明确控制语言模型,使其在生成文本时交织目标风格:例如,生成既消极又无毒的文本。此类可控生成的一种方法是多目标强化学习 (RL),但如何在奖励函数中最佳地组合多个目标仍是一个未解之谜。在本文中,我们研究了多风格奖励的各种公式,包括来自判别器的校准输出和基于判别器梯度幅值的动态加权。我们发现,我们提出的动态加权在保持语言质量的同时,在风格控制方面优于静态加权方法,并探讨了其在双风格和三风格控制中的有效性。

关键词

引用

@article{arxiv.2402.14146,
  title  = {Dynamic Multi-Reward Weighting for Multi-Style Controllable Generation},
  author = {Karin de Langis and Ryan Koo and Dongyeop Kang},
  journal= {arXiv preprint arXiv:2402.14146},
  year   = {2025}
}