中文

CroCoSum:一种跨语言语码转换摘要的基准数据集

计算与语言 2024-05-24 v2

摘要

近年来,由于大规模网络挖掘数据集的出现以及多语言语言模型的进步,跨语言摘要(CLS)引起了越来越多的关注。然而,鉴于自然出现的 CLS 资源十分稀少,大多数数据集不得不依赖翻译,而翻译可能包含过于字面的伪影。这限制了我们观察自然出现的 CLS 对的能力,这类语对包含有机的措辞,包括语码转换实例。这种在信息中途切换语言的现象在多语言环境中十分常见,但由于数据稀缺,在跨语言语境中很大程度上被忽视。为弥补这一空白,我们推出 CroCoSum,一个科技新闻的跨语言语码转换摘要数据集。它包含超过 24,000 篇英文源文章和 18,000 篇人工撰写的中文新闻摘要,其中超过 92% 的摘要含有语码转换短语。作为参考,我们评估了现有方法(包括流水线、端到端和零样本方法)的性能。我们表明,利用现有 CLS 资源作为预训练步骤并不能提升在 CroCoSum 上的表现,说明当前数据集的泛化能力有限。最后,我们通过定性错误分析讨论了在语码转换生成上评估跨语言摘要器的挑战。

关键词

引用

@article{arxiv.2303.04092,
  title  = {CroCoSum: A Benchmark Dataset for Cross-Lingual Code-Switched Summarization},
  author = {Ruochen Zhang and Carsten Eickhoff},
  journal= {arXiv preprint arXiv:2303.04092},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024