用于零样本多语言抽取式摘要的神经标签搜索
计算与语言
2022-05-02 v2 人工智能
摘要
在零样本多语言抽取式文本摘要中,模型通常在英语摘要数据集上训练,然后应用于其他语言的摘要数据集。给定英语黄金摘要与文档,句子级抽取式摘要标签通常使用启发式方法生成。然而,这些在英语数据集上创建的单语标签在其他语言数据集上可能并非最优,因为不同语言之间存在句法或语义差异。由此,可以将英语数据集翻译为其他语言并再次使用启发式方法获得不同的标签集合。为充分利用这些不同标签集合的信息,我们提出 NLSSum(用于摘要的神经标签搜索),其与我们的摘要模型共同学习这些不同标签集合的层次化权重。我们在 MLSUM 和 WikiLingua 数据集上进行多语言零样本摘要实验,并在这两个数据集上通过人工与自动评测均取得了最先进的结果。
引用
@article{arxiv.2204.13512,
title = {Neural Label Search for Zero-Shot Multi-Lingual Extractive Summarization},
author = {Ruipeng Jia and Xingxing Zhang and Yanan Cao and Shi Wang and Zheng Lin and Furu Wei},
journal= {arXiv preprint arXiv:2204.13512},
year = {2022}
}