跨语言摘要的对比学习方法:数据稀缺情境下的ConVerSum方案
计算与语言
2024-11-27 v2
摘要
跨语言摘要(CLS)是自然语言处理中的一个高级分支,需要模型准确翻译并总结来自不同源语言的文章。尽管后续研究取得了进展,但该领域仍需数据高效解决方案以及有效的训练方法。到目前为止,尚无可行方案可应用于不存在高质量CLS数据的情形。本文提出一种新颖的数据高效方法ConVerSum,用于CLS,利用对比学习的强大能力,基于给定源文档生成不同语言的多样化候选摘要,并与给定文档相关的参考摘要进行对比。随后,我们采用对比排序损失训练模型。我们严格评估了所提方法与当前方法的性能,并与强大的大型语言模型(LLMs)——Gemini、GPT 3.5和GPT 4o进行比较,证明我们的模型在低资源语言的CLS任务中表现更佳。这些发现代表该领域的重大进展,为更高效和准确的跨语言摘要技术开辟了新的可能性。
引用
@article{arxiv.2408.09273,
title = {ConVerSum: A Contrastive Learning-based Approach for Data-Scarce Solution of Cross-Lingual Summarization Beyond Direct Equivalents},
author = {Sanzana Karim Lora and M. Sohel Rahman and Rifat Shahriyar},
journal= {arXiv preprint arXiv:2408.09273},
year = {2024}
}