中文

BeliN:基于上下文特征融合的孟加拉宗教新闻标题生成语料库

计算与语言 2025-01-03 v1 机器学习

摘要

自动文本摘要,尤其是标题生成,仍是孟加拉语宗教新闻中尚未得到充分探索的关键领域。现有的标题生成方法通常仅依赖文章内容,忽视了诸如情感、类别和方面等关键上下文特征,显著限制了其效果和整体性能。为此,本研究引入一种新型语料库 BeliN(Bengali Religious News)——由孟加拉国著名在线报纸的宗教新闻文章组成,以及基于上下文特征融合的 MultiGen 标题生成方法。利用如 BanglaT5、mBART、mT5 和 mT0 等基于变换器的预训练语言模型,MultiGen 将额外的上下文特征——包括类别、方面和情感——与新闻内容融合。这种融合使模型能够捕获传统方法常忽视的关键上下文信息。实验结果表明,MultiGen 在 BLEU 分数上达到 18.61,ROUGE-L 分数达到 24.19,显著优于仅使用新闻内容的基线方法(分别为 16.08 和 23.08)。这些发现凸显了在低资源语言中 incorporating 上下文特征对标题生成的重要性。通过弥合语言和文化之间的差距,本研究推动了孟加拉语及其他其他欠代表语的自然语言处理领域的发展。为促进可重复性和进一步探索,数据集和实现代码已公开访问于 https://github.com/akabircs/BeliN。

关键词

引用

@article{arxiv.2501.01069,
  title  = {BeliN: A Novel Corpus for Bengali Religious News Headline Generation using Contextual Feature Fusion},
  author = {Md Osama and Ashim Dey and Kawsar Ahmed and Muhammad Ashad Kabir},
  journal= {arXiv preprint arXiv:2501.01069},
  year   = {2025}
}

备注

28 pages, 4 figures, 11 tables