ClidSum:面向跨语言对话摘要的基准数据集
计算与语言
2022-10-18 v2 人工智能
摘要
我们提出 ClidSum,一个用于构建对话文档上跨语言摘要系统的基准数据集。它包含来自两个子集(即 SAMSum 和 MediaSum)的 67k+ 对话文档,以及 112k+ 种不同目标语言的标注摘要。基于所提出的 ClidSum,我们分别引入了有监督和半监督场景下的两种基准设定。随后,我们在不同范式(流水线式和端到端)下构建了多种基线系统,并在 ClidSum 上进行了大量实验以提供更深入的分析。此外,我们提出了 mDialBART,它通过进一步预训练扩展了 mBART-50(一种多语言 BART)。进一步预训练阶段使用的多个目标帮助预训练模型捕捉对话中的结构特征及重要内容,以及从源语言到目标语言的转换。实验结果表明,mDialBART 作为一个端到端模型,在 ClidSum 上优于强大的流水线模型。最后,我们讨论了当前方法在该任务上面临的具体挑战,并给出了多个有前景的未来研究方向。我们已在 https://github.com/krystalan/ClidSum 发布了数据集和代码。
引用
@article{arxiv.2202.05599,
title = {ClidSum: A Benchmark Dataset for Cross-Lingual Dialogue Summarization},
author = {Jiaan Wang and Fandong Meng and Ziyao Lu and Duo Zheng and Zhixu Li and Jianfeng Qu and Jie Zhou},
journal= {arXiv preprint arXiv:2202.05599},
year = {2022}
}
备注
Accepted to EMNLP 2022 (main conference)