语言建模的范式转变:重新审视CNN以建模梵语源孟加拉语与印地语
计算与语言
2021-11-08 v2
摘要
尽管近期针对英语和汉语等高资源语言的语言建模(LM)已有大量工作,但对于孟加拉语和印地语等低资源语言,该领域仍未被探索。我们提出了一种端到端可训练、内存高效的CNN架构,名为CoCNN,以处理孟加拉语和印地语的特定特征,如高屈折性、形态丰富性、灵活的词序以及语音拼写错误。具体而言,我们引入了在词级和句子级的两个可学习卷积子模型,它们是端到端可训练的。我们表明,包括预训练BERT在内的先进(state-of-the-art, SOTA) Transformer模型未必能为孟加拉语和印地语带来最佳性能。CoCNN以少16倍的参数优于预训练BERT,并且在多个真实世界数据集上比SOTA LSTM模型取得好得多的性能。这是首个关于从三种深度学习范式——卷积、循环和Transformer神经网络中选取的不同架构对两种广泛使用语言孟加拉语和印地语建模有效性的研究。
引用
@article{arxiv.2110.13032,
title = {Paradigm Shift in Language Modeling: Revisiting CNN for Modeling Sanskrit Originated Bengali and Hindi Language},
author = {Chowdhury Rafeed Rahman and MD. Hasibur Rahman and Mohammad Rafsan and Samiha Zakir and Mohammed Eunus Ali and Rafsanjani Muhammod},
journal= {arXiv preprint arXiv:2110.13032},
year = {2021}
}