中文

SimCSum:面向跨语言科学新闻简化的与跨语言摘要联合学习

计算与语言 2023-04-05 v1

摘要

跨语言科学新闻为非专家受众生成与源语言不同的科学文章的科普故事。因此,跨语言科普摘要必须包含输入文档的显著内容,且内容应连贯、易懂,并以面向目标受众的本地语言呈现。我们通过联合训练简化与跨语言摘要这两个高层 NLP 任务,改进了跨语言摘要生成的这些方面。前者降低语言复杂度,后者聚焦于跨语言生成式摘要。我们提出一种新颖的多任务架构——SimCSum,由一个共享编码器和两个并行解码器组成,联合学习简化与跨语言摘要。我们通过将其与多个强基线在若干评估指标上比较以及人工评估,实证考察了 SimCSum 的性能。总体而言,SimCSum 在两个非合成跨语言科学数据集上相较当前最优方法取得了统计显著的提升。此外,我们对生成摘要的语言特性进行了深入探究并开展了错误分析。

关键词

引用

@article{arxiv.2304.01621,
  title  = {SimCSum: Joint Learning of Simplification and Cross-lingual Summarization for Cross-lingual Science Journalism},
  author = {Mehwish Fatima and Tim Kolber and Katja Markert and Michael Strube},
  journal= {arXiv preprint arXiv:2304.01621},
  year   = {2023}
}