中文

TextSETTR:少样本文本风格提取与可调定向重塑

计算与语言 2021-06-24 v3 机器学习

摘要

我们提出一种解决文本风格迁移问题的新方法。与以往需要风格标注训练数据的方法不同,我们的方法利用相邻句子间风格的隐式关联来使用现成可用的无标注文本,并仅在推理时使用标注数据。我们适配 T5(Raffel 等,2020)——一个强大的预训练文本到文本模型——以从文本中提取风格向量,并用其调节解码器来执行风格迁移。由于我们的无标签训练产生了一个编码风格多方面特征的风格向量空间,我们将迁移重新定义为调整输入特定属性同时保留其他属性的“定向重塑”向量操作。我们证明,在无标注 Amazon 评论数据上训练可得到一个在情感迁移上具竞争力的模型,即便与完全在标注数据上训练的模型相比亦然。此外,将我们的新方法应用于多样化的无标注网络文本语料,可得到一个单一模型,能够在多个风格维度(方言、情绪性、正式度、礼貌度、情感)上进行迁移,且无需额外训练,仅在推理时使用少量示例。

关键词

引用

@article{arxiv.2010.03802,
  title  = {TextSETTR: Few-Shot Text Style Extraction and Tunable Targeted Restyling},
  author = {Parker Riley and Noah Constant and Mandy Guo and Girish Kumar and David Uthus and Zarana Parekh},
  journal= {arXiv preprint arXiv:2010.03802},
  year   = {2021}
}