中文

基于属性正则化扩散的可控语体文本生成

计算与语言 2025-10-09 v1

摘要

生成具有特定属性的语体文本是可控文本生成的关键问题。最近,扩散模型作为强大的视觉和文本生成范式涌现。现有方法可大致分为无分类器引导(CFG)和分类器引导(CG)方法。虽然CFG有效保持语义内容,但往往难以提供有效的属性控制;相比之下,CG通过分类器梯度修改去噪轨迹,实现更好的属性对齐,但在抽样时计算成本高且存在分类器泛化问题。本文提出RegDiff,一种正则化扩散框架,无需在抽样阶段使用预训练分类器即可利用属性特征,实现可控生成并降低计算成本。具体而言,RegDiff采用基于VAE的编码器-解码器架构确保重构保真度,并训练带有属性监督的潜在扩散模型以实现可控文本生成。属性信息仅在训练时注入。实验在覆盖多种语体属性的五个数据集上表明,RegDiff 在生成语体文本方面优于强大基线。这些结果验证了RegDiff作为高效属性可控文本扩散解决方案的有效性。我们将在发表后在 https://github.com/xxxx 上发布代码、数据集和资源。

关键词

引用

@article{arxiv.2510.06386,
  title  = {Controllable Stylistic Text Generation with Train-Time Attribute-Regularized Diffusion},
  author = {Fan Zhou and Chang Tian and Tim Van de Cruys},
  journal= {arXiv preprint arXiv:2510.06386},
  year   = {2025}
}

备注

Preprint under review