中文

跨语言摘要的对比学习方法:数据稀缺情境下的ConVerSum方案

计算与语言 2024-11-27 v2

摘要

跨语言摘要(CLS)是自然语言处理中的一个高级分支,需要模型准确翻译并总结来自不同源语言的文章。尽管后续研究取得了进展,但该领域仍需数据高效解决方案以及有效的训练方法。到目前为止,尚无可行方案可应用于不存在高质量CLS数据的情形。本文提出一种新颖的数据高效方法ConVerSum,用于CLS,利用对比学习的强大能力,基于给定源文档生成不同语言的多样化候选摘要,并与给定文档相关的参考摘要进行对比。随后,我们采用对比排序损失训练模型。我们严格评估了所提方法与当前方法的性能,并与强大的大型语言模型(LLMs)——Gemini、GPT 3.5和GPT 4o进行比较,证明我们的模型在低资源语言的CLS任务中表现更佳。这些发现代表该领域的重大进展,为更高效和准确的跨语言摘要技术开辟了新的可能性。

关键词

引用

@article{arxiv.2408.09273,
  title  = {ConVerSum: A Contrastive Learning-based Approach for Data-Scarce Solution of Cross-Lingual Summarization Beyond Direct Equivalents},
  author = {Sanzana Karim Lora and M. Sohel Rahman and Rifat Shahriyar},
  journal= {arXiv preprint arXiv:2408.09273},
  year   = {2024}
}