通过采用最优传输距离进行知识蒸馏改进神经跨语言摘要
计算与语言
2021-12-08 v1
摘要
当前最先进的跨语言摘要模型采用多任务学习范式,其工作于共享词表模块并依赖自注意力机制在两种语言的词元间进行注意力计算。然而,自注意力学习到的关联往往松散且隐式,难以高效捕捉语言间关键的跨语言表示。当处理具有不同形态或结构特征的语言时,问题加剧,使跨语言对齐更具挑战性,导致性能下降。为克服该问题,我们提出一种基于知识蒸馏的跨语言摘要框架,旨在通过将对单语摘要教师模型的知识蒸馏到跨语言摘要学生模型来显式构建跨语言关联。由于教师与学生表示位于两个不同向量空间,我们进一步提出使用 Sinkhorn 散度(一种最优传输距离)的知识蒸馏损失,以估计教师与学生表示间的差异。得益于 Sinkhorn 散度直观的几何性质,学生模型可有效学习将其生成的跨语言隐状态与单语隐状态对齐,从而在远距离语言间建立强关联。在远距离语言对的跨语言摘要数据集上的实验表明,我们的方法在高资源与低资源设置下均优于最先进模型。
引用
@article{arxiv.2112.03473,
title = {Improving Neural Cross-Lingual Summarization via Employing Optimal Transport Distance for Knowledge Distillation},
author = {Thong Nguyen and Luu Anh Tuan},
journal= {arXiv preprint arXiv:2112.03473},
year = {2021}
}
备注
Accepted by 36th AAAI Conference on Artificial Intelligence (AAAI 2022)