中文

LingGen: 通过幂律掩码实现可扩展的多属性语言学控制

计算与语言 2026-01-27 v2

摘要

我们提出了 LingGen,一个受控文本生成模型,允许对大量实值语言学属性进行细粒度控制。它使用专用的语言学属性编码器对目标属性值进行编码,并通过将生成的表示注入语言模型的开头标记(BOS)嵌入来对语言模型进行条件化。为了提高控制不同属性子集时的鲁棒性,我们引入了 P-MASKING,它在训练期间从截断的帕累托分布中采样每个示例的属性掩码率。在 1 到 40 个控制属性范围内,LingGen 在所有评估方法中实现了最低的平均控制误差,同时在推理时保持高效,并在人工评估中获得最高的流畅度分数。消融实验表明,与替代的掩码和集成变体相比,帕累托采样掩码和基于 BOS 的注入是有效的选择。

关键词

引用

@article{arxiv.2410.24201,
  title  = {LingGen: Scalable Multi-Attribute Linguistic Control via Power-Law Masking},
  author = {Mohamed Elgaar and Hadi Amiri},
  journal= {arXiv preprint arXiv:2410.24201},
  year   = {2026}
}

备注

EACL 2026