面向神经复述生成的粒度连续分解
计算与语言
2022-09-19 v2
摘要
尽管Transformer在段落生成中取得了显著成功,但它们将句子视为token的线性序列,往往忽略其层次信息。先前工作表明,对输入token的粒度层次(如词、短语或句子)进行分解可带来实质性改进,暗示可通过更细粒度的粒度建模来增强Transformer。本工作中,我们提出一种面向神经复述生成的粒度连续分解(C-DNPG)。为高效将粒度融入句子编码,C-DNPG引入了粒度感知注意力(GA-Attention)机制,其扩展了多头自注意力:1)一个粒度头,通过神经估计每个输入token的粒度级别来自动推断句子的层次结构;2)两种新颖的注意力掩码,即粒度共振与粒度范围,以高效将粒度编码进注意力。在Quora问题对和Twitter URL两个基准上的实验表明,C-DNPG以显著优势超越基线模型,并在多项指标上取得最先进结果。定性分析揭示C-DNPG确实有效捕获了细粒度级别。
引用
@article{arxiv.2209.01765,
title = {Continuous Decomposition of Granularity for Neural Paraphrase Generation},
author = {Xiaodong Gu and Zhaowei Zhang and Sang-Woo Lee and Kang Min Yoo and Jung-Woo Ha},
journal= {arXiv preprint arXiv:2209.01765},
year = {2022}
}
备注
Accepted to be published in COLING 2022