HydraSum:基于多解码器模型解耦文本摘要中的风格特征
计算与语言
2022-10-24 v4
摘要
摘要系统在推理过程中会对摘要属性做出大量“决策”,例如复制程度、输出的具体性以及长度等。然而,这些属性被隐式编码在模型参数中,无法强制指定特定风格。为此,我们提出 HydraSum,一种新的摘要架构,它将当前模型的单解码器框架扩展为具有多个解码器的混合专家(mixture-of-experts)版本。我们表明,在标准训练目标下无需任何额外监督,HydraSum 的多个解码器会自动学习出对比鲜明的摘要风格。通过在三个摘要数据集(CNN、Newsroom 和 XSum)上的实验,我们证明 HydraSum 提供了一种简单机制,可通过从单个解码器或其混合中采样来获得风格多样的摘要,优于基线模型。最后,我们证明对训练过程中的门控策略做微小修改即可强制实现更严格的风格划分,例如高抽象度 vs 低抽象度或高具体性 vs 低具体性,使用户能够在更大的生成空间中采样,并沿多个维度变化摘要风格。
引用
@article{arxiv.2110.04400,
title = {HydraSum: Disentangling Stylistic Features in Text Summarization using Multi-Decoder Models},
author = {Tanya Goyal and Nazneen Fatema Rajani and Wenhao Liu and Wojciech Kryściński},
journal= {arXiv preprint arXiv:2110.04400},
year = {2022}
}
备注
EMNLP2022