中文

跨语言跨时代摘要:数据集、模型与评估

计算与语言 2024-06-04 v3

摘要

尽管摘要任务在自然语言处理(NLP)中已被广泛研究,跨语言跨时代摘要(CLCTS)仍是一个很大程度上未被探索、却有望改善跨文化交流与理解的领域。本文全面探讨 CLCTS 任务,包括数据集构建、建模与评估。我们(1)利用英语和德语的历史小说文本及维基百科摘要,构建了首个 CLCTS 语料库,其中 hDe-En 有 328 个实例(扩展版 455 个),hEn-De 有 289 个实例(扩展版 501 个);(2)考察了具有不同中间微调任务的流行 transformer 端到端模型的有效性;(3)探索了 GPT-3.5 作为摘要器的潜力;(4)报告了来自人类、GPT-4 及若干近期自动评估指标的评估结果。我们的结果表明,经过中间任务微调的端到端模型生成的摘要质量从差到中等,而 GPT-3.5 作为零样本摘要器提供了中等至良好质量的输出。GPT-3.5 似乎还非常擅长规范化历史文本。为评估 GPT-3.5 中的数据污染,我们设计了一种对抗攻击方案,发现对于未见的源文档,GPT-3.5 的表现比已见文档略差。此外,当源句以其先验知识相反的方式倒置时,它有时会产生幻觉,摘要准确率在情节省略上为 0.67,实体交换上为 0.71,情节否定上为 0.53。总体而言,我们对模型表现的回归结果表明,更长、更古老且更复杂的源文本(这些更具历史语言变体的特征)对所有模型都更难摘要,表明 CLCTS 任务的难度。

关键词

引用

@article{arxiv.2306.12916,
  title  = {Cross-lingual Cross-temporal Summarization: Dataset, Models, Evaluation},
  author = {Ran Zhang and Jihed Ouni and Steffen Eger},
  journal= {arXiv preprint arXiv:2306.12916},
  year   = {2024}
}

备注

Computational Linguistics. Submitted manuscript. https://direct.mit.edu/coli/article/doi/10.1162/coli_a_00519/121095/Cross-lingual-Cross-temporal-Summarization-Dataset