中文

用于可控强度的无监督文本风格迁移

计算与语言 2026-01-06 v1

摘要

无监督文本风格迁移(UTST)旨在构建一个在没有平行文本对的情况下,将给定文本的风格属性进行迁移的系统。与在不同风格极性之间进行文本迁移相比,UTST for 可控强度更具挑战性,因为不同强度水平之间的风格特征差异微妙。面对缺乏平行数据和相邻强度水平难以区分的挑战,我们提出了 SFT-then-PPO 方法来微调大语言模型。我们首先使用合成的平行数据对大语言模型进行微调。然后,我们进一步使用 PPO 进行训练,其中奖励函数经过精心设计,用于在层次化水平上区分文本的风格强度。考虑了全局和局部风格特征以构建奖励函数。在两个 UTST 基准测试上的实验表明,两种奖励函数各有优势,并且将它们应用于大语言模型微调可以有效提高基于各种评估指标的大语言模型背板的性能。即使在接近的强度水平,我们仍能观察到生成文本之间显著的风格差异。

关键词

引用

@article{arxiv.2601.01060,
  title  = {Unsupervised Text Style Transfer for Controllable Intensity},
  author = {Shuhuan Gu and Wenbiao Tao and Xinchen Ma and Kangkang He and Ye Guo and Xiang Li and Yunshi Lan},
  journal= {arXiv preprint arXiv:2601.01060},
  year   = {2026}
}