为摘要排序:基于排序方法增强孟加拉语文本摘要
计算与语言
2023-07-17 v1 人工智能
摘要
随着对高效且准确的文本摘要技术需求的增长,探索提升专为孟加拉语文本摘要定制的预训练模型质量与精度的途径变得至关重要。在文本摘要任务方面,人们可使用众多预训练 transformer 模型。因此,在这些预训练摘要模型生成的多种选项中,辨别出给定文本最具信息量且最相关的摘要成为一项挑战。本文旨在利用一种简单而有效的基于排序的方法,比较四种不同预训练孟加拉语文本摘要模型的输出,从而识别出给定文本最准确且最具信息量的摘要。该过程首先对输入文本进行预处理,剔除特殊字符和标点符号等不必要元素。接下来,我们利用四种预训练摘要模型生成摘要,然后应用文本排序算法以确定最合适的摘要。最终,排名得分最高的摘要被选为最终摘要。为评估该方法的有效性,使用 BLEU、ROUGE、BERTScore、WIL、WER 和 METEOR 等标准 NLG 指标将生成摘要与人工标注摘要进行比较。实验结果表明,通过利用各预训练 transformer 模型的优势并以基于排序的方法加以组合,我们的方法显著提升了孟加拉语文本摘要的准确度和有效性。
引用
@article{arxiv.2307.07392,
title = {Rank Your Summaries: Enhancing Bengali Text Summarization via Ranking-based Approach},
author = {G. M. Shahariar and Tonmoy Talukder and Rafin Alam Khan Sotez and Md. Tanvir Rouf Shawon},
journal= {arXiv preprint arXiv:2307.07392},
year = {2023}
}
备注
Accepted in International Conference on Big Data, IoT and Machine Learning 2023 (BIM 2023)