MultiBanAbs:一个全面的多领域孟加拉语摘要文本数据集
计算与语言
2025-12-17 v1 人工智能
摘要
本研究开发了一个新的孟加拉语摘要数据集,用于生成来自多种来源的孟加拉语文章的简洁摘要。该领域的大多数现有研究集中于新闻文章,记者通常遵循固定的写作风格。虽然此类方法在有限语境下有效,但它们往往无法适应真实孟加拉语文本的多样性。在当今数字时代,大量孟加拉语内容持续在博客、报纸和社交媒体中产生。这迫切需要能够减轻信息过载并帮助读者更快理解内容的摘要系统。为应对这一挑战,我们开发了一个包含超过 54,000 篇孟加拉语文章和摘要的数据集,来源涵盖多个领域,包括 Cinegolpo 等博客和 Samakal、The Business Standard 等报纸。与单一领域资源不同,我们的数据集涵盖多个领域和写作风格,具有更强的适应性和实际相关性。为建立强有力的基线,我们使用多种深度学习和迁移学习模型对该数据集进行了训练和评估,包括 LSTM、BanglaT5-small 和 MTS-small。结果突显了其作为孟加拉语自然语言处理未来研究基准的潜力。该数据集为构建鲁棒的摘要系统奠定了坚实基础,并有助于扩展低资源语言的 NLP 资源。
引用
@article{arxiv.2511.19317,
title = {MultiBanAbs: A Comprehensive Multi-Domain Bangla Abstractive Text Summarization Dataset},
author = {Md. Tanzim Ferdous and Naeem Ahsan Chowdhury and Prithwiraj Bhattacharjee},
journal= {arXiv preprint arXiv:2511.19317},
year = {2025}
}