中文

面向多语言与跨语言摘要统一的探索

计算与语言 2023-05-17 v1 人工智能

摘要

为使文本摘要适应多语言世界,已有工作提出了多语言摘要(MLS)与跨语言摘要(CLS)。然而,由于定义不同,这两项任务一直被分开研究,限制了对二者的兼容性与系统性研究。本文旨在将 MLS 与 CLS 统一为更通用的设定,即多对多摘要(M2MS),其中单一模型可处理任意语言的文档并生成任意语言的摘要。作为迈向 M2MS 的第一步,我们进行了初步研究,表明 M2MS 比 MLS 和 CLS 能更好地在不同语言间迁移任务知识。此外,我们提出了 Pisces,一种预训练 M2MS 模型,通过三阶段预训练学习语言建模、跨语言能力与摘要能力。实验结果表明,我们的 Pisces 显著优于最先进的基线,尤其在零样本方向上,即不存在从源语言文档到目标语言摘要的训练数据时有明显优势。

关键词

引用

@article{arxiv.2305.09220,
  title  = {Towards Unifying Multi-Lingual and Cross-Lingual Summarization},
  author = {Jiaan Wang and Fandong Meng and Duo Zheng and Yunlong Liang and Zhixu Li and Jianfeng Qu and Jie Zhou},
  journal= {arXiv preprint arXiv:2305.09220},
  year   = {2023}
}

备注

Accepted at ACL 2023 as a long paper of the main conference