重访跨语言摘要:基于语料库的研究与带改进标注的新基准
计算与语言
2023-07-11 v1
摘要
大多数现有跨语言摘要(CLS)工作通过简单直接地将一种语言预标注的摘要翻译为另一种语言来构建 CLS 语料库,这可能包含来自摘要与翻译过程的双重错误。为解决此问题,我们提出 ConvSumX,一个跨语言对话摘要基准,采用显式考虑源输入上下文的新标注模式。ConvSumX 包含不同真实场景下的 2 个子任务,每个覆盖 3 个语言方向。我们对 ConvSumX 与 3 个广泛使用的手动标注 CLS 语料库进行透彻分析,并经验性地发现 ConvSumX 对输入文本更忠实。此外,基于相同直觉,我们提出一种 2-Step 方法,将对话与摘要均作为输入以模拟人类标注过程。实验结果显示 2-Step 方法在自动与人工评估下均超越 ConvSumX 上的强基线。分析表明源输入文本与摘要对建模跨语言摘要均至关重要。
引用
@article{arxiv.2307.04018,
title = {Revisiting Cross-Lingual Summarization: A Corpus-based Study and A New Benchmark with Improved Annotation},
author = {Yulong Chen and Huajian Zhang and Yijie Zhou and Xuefeng Bai and Yueguan Wang and Ming Zhong and Jianhao Yan and Yafu Li and Judy Li and Michael Zhu and Yue Zhang},
journal= {arXiv preprint arXiv:2307.04018},
year = {2023}
}
备注
ACL2023