中文

X-SCITLDR:学术文献的跨语言极端摘要

计算与语言 2022-05-31 v1

摘要

当今科学出版物数量快速增长,导致研究人员信息过载,并使学者难以跟上当前趋势与工作脉络。因此,近期将文本挖掘技术应用于学术出版物的工作已探究了自动文本摘要技术(包括极端摘要)在该领域的应用。然而,以往工作仅集中于单语环境,主要是英语。本文中,我们填补这一研究空白,提出一个面向学术领域四种不同语言的抽取式跨语言摘要数据集,其使我们能够训练并评估处理英文论文并生成德文、意大利文、中文与日文摘要的模型。我们提出新的多语言摘要 X-SCITLDR 数据集,并基于最先进的多语言预训练模型对不同的模型进行详尽基准测试,包括两阶段“先摘要后翻译”方法与直接跨语言模型。我们还探索了以英文单语摘要与机器翻译作为中间任务的中间阶段训练所带来的益处,并分析了零样本与少样本场景下的性能。

关键词

引用

@article{arxiv.2205.15051,
  title  = {X-SCITLDR: Cross-Lingual Extreme Summarization of Scholarly Documents},
  author = {Sotaro Takeshita and Tommaso Green and Niklas Friedrich and Kai Eckert and Simone Paolo Ponzetto},
  journal= {arXiv preprint arXiv:2205.15051},
  year   = {2022}
}

备注

JCDL2022