中文

基于精确高效分层 RNN 模型的语言建模大小写归一化

计算与语言 2022-02-17 v1 机器学习

摘要

大小写归一化(真值大小写还原,truecasing)是恢复噪声文本正确大小写(大写或小写)的任务。我们提出了一种快速、准确且紧凑的基于词与字符的两级分层循环神经网络模型。我们使用该 truecaser 在联邦学习框架中归一化用户生成文本以进行语言建模。在此归一化文本上训练的区分大小写语言模型达到了与在具有金标准大小写文本上训练的模型相同的困惑度。在真实用户 A/B 实验中,我们证明该改进转化为虚拟键盘应用中预测错误率的降低。类似地,在 ASR 语言模型融合实验中,我们展示了大写字符错误率与词错误率的降低。

关键词

引用

@article{arxiv.2202.08171,
  title  = {Capitalization Normalization for Language Modeling with an Accurate and Efficient Hierarchical RNN Model},
  author = {Hao Zhang and You-Chi Cheng and Shankar Kumar and W. Ronny Huang and Mingqing Chen and Rajiv Mathews},
  journal= {arXiv preprint arXiv:2202.08171},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2108.11943