中文

Bangla Key2Text:面向低资源语言的关键词文本生成

计算与语言 2026-04-22 v1

摘要

本文介绍了 \textit{Bangla Key2Text},一个包含 2.62.6 百万个 Bangla 关键词-文本对的大规模数据集,专为低资源语言的关键词驱动文本生成而设计。该数据集使用基于 BERT 的关键词抽取流水线构建,应用于数百万篇 Bangla 新闻文本,将原始文章转化为适合监督学习的结构化关键词-文本对。为了建立在这个新基准上的基线性能,我们微调了两个序列到序列模型 \texttt{mT5} 和 \texttt{BanglaT5},并使用多种自动指标和人工评估对它们进行评价。实验结果表明,与零样本大语言模型相比,特定任务的微调显著改善了 Bangla 中关键词条件的文本生成。数据集、训练好的模型和代码已公开发布,以支持未来在 Bangla 自然语言生成和关键词到文本生成任务方面的研究。

关键词

引用

@article{arxiv.2604.19508,
  title  = {Bangla Key2Text: Text Generation from Keywords for a Low Resource Language},
  author = {Tonmoy Talukder and G M Shahariar},
  journal= {arXiv preprint arXiv:2604.19508},
  year   = {2026}
}

备注

18 pages, uses lrec2026.sty