记忆注意力融合:面向基于 Transformer 的序列到序列模型的外部语言模型集成
计算与语言
2020-10-30 v1
摘要
本文提出一种将外部语言模型(LM, language model)集成到基于 Transformer 的序列到序列(seq2seq, sequence-to-sequence)模型中的新颖融合方法。虽然训练 seq2seq 模型基本需要配对数据,但外部 LM 仅用非配对数据即可训练。因此,在构建 seq2seq 模型时利用外部 LM 中的记忆知识十分重要,因为难以准备大量配对数据。然而,现有融合方法假设 LM 与基于循环神经网络的 seq2seq 模型集成,而非 Transformer。故此,本文提出一种能显式利用 Transformer 中网络结构的融合方法。所提方法称为{\bf 记忆注意力融合}(memory attentive fusion),借助 Transformer 风格的注意力机制,以多跳方式重复源-目标注意力,以读取 LM 中的记忆知识。我们在两个文本风格转换任务上的实验表明,所提方法优于传统融合方法。
引用
@article{arxiv.2010.15437,
title = {Memory Attentive Fusion: External Language Model Integration for Transformer-based Sequence-to-Sequence Model},
author = {Mana Ihori and Ryo Masumura and Naoki Makishima and Tomohiro Tanaka and Akihiko Takashima and Shota Orihashi},
journal= {arXiv preprint arXiv:2010.15437},
year = {2020}
}
备注
Accepted as a short paper at INLG 2020