中文

CrossSum:面向1500余种语言对的超越以英语为中心的多语言跨语言摘要数据集

计算与语言 2023-05-29 v3

摘要

我们提出CrossSum,一个包含1500余种语言对中168万条文章-摘要样本的大规模跨语言摘要数据集。我们通过跨语言检索从多语言抽象式摘要数据集中对齐不同语言撰写的平行文章来构建CrossSum,并进行了受控人工评估以验证其质量。我们提出了一种多阶段数据采样算法,以有效训练能够用任意目标语言对文章进行摘要的跨语言摘要模型。我们还引入了LaSE,一种基于嵌入的自动评估模型生成摘要的指标。LaSE与ROUGE高度相关,且不同于ROUGE,即使在缺乏目标语言参考摘要的情况下也能可靠度量。在ROUGE和LaSE上的性能表明,我们提出的模型持续优于基线模型。据我们所知,CrossSum是最大的跨语言摘要数据集,也是首个不以英语为中心的数据集。我们发布了该数据集、训练与评估脚本以及模型,以推动跨语言摘要的未来研究。相关资源可在 https://github.com/csebuetnlp/CrossSum 获取。

关键词

引用

@article{arxiv.2112.08804,
  title  = {CrossSum: Beyond English-Centric Cross-Lingual Summarization for 1,500+ Language Pairs},
  author = {Abhik Bhattacharjee and Tahmid Hasan and Wasi Uddin Ahmad and Yuan-Fang Li and Yong-Bin Kang and Rifat Shahriyar},
  journal= {arXiv preprint arXiv:2112.08804},
  year   = {2023}
}

备注

ACL 2023 (camera-ready)