中文

组合 RNN 与 FST 以应对小数据:恢复古夏威夷文本中缺失的字符

计算与语言 2022-08-23 v1 机器学习

摘要

与19世纪较古老的书写系统相比,现代夏威夷正字法使用表示长元音和喉塞音的字符。这些额外字符约占夏威夷语音素的三分之一,因此包含它们对阅读理解和发音有很大影响。然而,在旧文本与新文本之间进行音译若手动完成则是一项繁琐的任务。我们介绍了两种相关方法来帮助自动解决这一音译问题,鉴于当时没有足够的数据来训练端到端的深度学习模型。其中一种方法使用有限状态转换器(FST)端到端实现。另一种是一种混合深度学习方法,它近似地将一个 FST 与一个循环神经网络(RNN)进行组合。我们发现,该混合方法通过将原始问题划分为可由 FST 手工建模的一部分,以及可由在可用数据上训练的 RNN 轻松解决的另一部分,从而优于端到端 FST。

关键词

引用

@article{arxiv.2208.10248,
  title  = {Composing RNNs and FSTs for Small Data: Recovering Missing Characters in Old Hawaiian Text},
  author = {Oiwi Parker Jones and Brendan Shillingford},
  journal= {arXiv preprint arXiv:2208.10248},
  year   = {2022}
}

备注

This paper originally appeared in a NeurIPS Workshop in 2018: IRASL - Interpretability and Robustness in Audio, Speech, and Language. It builds on a shorter paper that appeared in the Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing (EMNLP). See acknowledgements for details