中文

面向被忽视语言的本地翻译服务

计算与语言 2021-01-15 v2 机器学习

摘要

利用计算轻量但高质量的翻译器,促使人们考虑面向被忽视语言的新应用。针对较冷门语言的本地运行翻译器,可协助处理受保护或个人数据的数据项目——这类数据在发布至公共翻译API前可能需特定合规检查,但若借助一支本地小规模成对翻译器队伍,则能提供合理且具成本效益的解决方案。如同处理专家方言,本研究展示了翻译两种历史上有趣但 obfuscated 的语言:1)黑客语("l33t")和2)达·芬奇所实践的逆向(或"镜像")书写。该工作将一种深度学习架构推广至含轻量、中等和困难词汇的黑客语可翻译变体。原始贡献在于一个低于50兆字节的流利黑客语翻译器,并展示了一个用超百万双语句子对扩充未来数据集的生成器。长短期记忆循环神经网络(LSTM-RNN)扩展了先前工作,证明了仅由少至10,000个双语句子对构建的英译外翻译服务。本工作进一步解决了另外二十六种(非 obfuscated)语言中的等效翻译问题,并以量化方式对这些模型及其熟练度排序,其中意大利语最成功、普通话最具挑战性。对于被忽视语言,该方法为较小众的翻译(如覆盖5-7百万使用者但多数企业翻译器尚未开发的阿尔及利亚方言卡拜尔语)原型化了新颖服务。人们预期此方法将扩展至其他重要方言,如翻译技术(医学或法律)行话和处理健康记录。

关键词

引用

@article{arxiv.2101.01628,
  title  = {Local Translation Services for Neglected Languages},
  author = {David Noever and Josh Kalin and Matt Ciolino and Dom Hambrick and Gerry Dozier},
  journal= {arXiv preprint arXiv:2101.01628},
  year   = {2021}
}