中文

通过扩展 RNN 结合双向 LSTM 的 n-gram 语言模型提升孟加拉语言的下一词预测与句子完成

计算与语言 2024-05-06 v1 机器学习

摘要

texting 是全球最主要的通信形式。个体花费大量时间编写完整文本来发送电子邮件或在社交媒体上发表内容,这在当代非常耗时。下一词预测和句子完成在孟加拉语言中将使文本信息更加方便和便利。本文通过引入一种 Bi-LSTM 模型,有效地处理孟加拉语言的下一词预测和孟加拉句子生成,展示了其多功能性和潜在影响。我们提出了一种新型 Bi-LSTM 模型,用于预测后续单词并完成句子。我们从多个新闻门户网站构建了语料库数据集,包括 bdnews24、BBC News Bangla 和 Prothom Alo。该方法在词预测方面取得了优异结果,4-gram 和 5-gram 词预测准确率均达到 99%。此外,它在现有方法上实现了显著改进,分别达到了 uni-gram、bi-gram 和 tri-gram 词预测的 35%、75% 和 95% 准确率。

关键词

引用

@article{arxiv.2405.01873,
  title  = {Enhancing Bangla Language Next Word Prediction and Sentence Completion through Extended RNN with Bi-LSTM Model On N-gram Language},
  author = {Md Robiul Islam and Al Amin and Aniqua Nusrat Zereen},
  journal= {arXiv preprint arXiv:2405.01873},
  year   = {2024}
}

备注

This paper contains 6 pages, 8 figures