中文

BanglaNLG 与 BanglaT5:孟加拉语低资源自然语言生成的评测基准与资源

计算与语言 2023-02-14 v4

摘要

本工作提出 BanglaNLG,一个用于评测孟加拉语(一种广泛使用但低资源的语言)自然语言生成(NLG)模型的综合基准。我们在 BanglaNLG 基准下汇聚了六项具有挑战性的条件文本生成任务,并在此过程中引入了一个新的对话生成数据集。此外,使用一个 27.5 GB 的干净孟加拉语语料库,我们预训练了 BanglaT5,一个面向孟加拉语的序列到序列 Transformer 语言模型。BanglaT5 在所有这些任务上均取得了最先进的性能,以高达 9% 的绝对提升和 32% 的相对提升优于多个多语言模型。我们将新的对话数据集和 BanglaT5 模型公开于 https://github.com/csebuetnlp/BanglaNLG,以期推进未来关于孟加拉语 NLG 的研究。

关键词

引用

@article{arxiv.2205.11081,
  title  = {BanglaNLG and BanglaT5: Benchmarks and Resources for Evaluating Low-Resource Natural Language Generation in Bangla},
  author = {Abhik Bhattacharjee and Tahmid Hasan and Wasi Uddin Ahmad and Rifat Shahriyar},
  journal= {arXiv preprint arXiv:2205.11081},
  year   = {2023}
}

备注

Findings of EACL 2023 (camera-ready)