学习用于序列生成的多尺度Transformer模型
计算与语言
2022-06-22 v1
摘要
多尺度特征层次结构已在计算机视觉领域见证了成功。这进一步激励研究人员为自然语言处理设计多尺度Transformer,主要基于自注意力机制。例如,限制跨头部的感受野或通过卷积提取局部细粒度特征。然而,现有大多数工作直接建模局部特征,却忽略了词边界信息。这导致了冗余且模糊的注意力分布,缺乏可解释性。在本工作中,我们在不同的语言单元中定义这些尺度,包括子词、词和短语。我们通过基于词边界信息和短语级先验知识建立尺度间关系,构建了一个多尺度Transformer模型。所提出的**通用多尺度Transformer**(**U**niversal **M**ulti**S**cale **T**ransformer),即\textsc{Umst},在两个序列生成任务上进行了评估。值得注意的是,它在多个测试集上相较于强基线取得了持续的性能提升,且未牺牲效率。
引用
@article{arxiv.2206.09337,
title = {Learning Multiscale Transformer Models for Sequence Generation},
author = {Bei Li and Tong Zheng and Yi Jing and Chengbo Jiao and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2206.09337},
year = {2022}
}
备注
accepted by ICML2022