中文

面向音译内容的语言检测

计算与语言 2024-01-10 v1

摘要

在当代数字时代,互联网充当了无与伦比的催化剂,打破了地理和语言障碍,这在短信交流中尤为明显。这种演变促进了全球通信,超越了物理距离,并培育了动态的文化交流。一个显著趋势是音译的广泛使用,即使用英文字母来传达母语信息,这给语言技术在准确检测源语言方面带来了独特挑战。本文通过一个由音译为英文的印地语和俄语手机短信组成的数据集来应对这一挑战,利用 BERT 进行语言分类,并利用 Google Translate API 进行音译转换。该研究开创了识别和转换音译文本的创新方法,应对了数字通信多样化语言环境中的挑战。我们强调综合数据集对于训练大型语言模型(LLMs)如 BERT 的关键作用,我们的模型在准确识别和分类音译文本的语言方面展示了卓越的能力。凭借 99% 的验证准确率,我们模型的稳健性能突显了其可靠性。对音译动态的全面探索,辅以创新方法和 BERT 等前沿技术,使我们的研究处于应对数字通信语言环境中独特挑战的前沿。这项工作不仅为语言识别和音译能力做出了贡献,还在内容审核、分析以及促进全球互联社区进行有意义的对话方面具有应用前景。

关键词

引用

@article{arxiv.2401.04619,
  title  = {Language Detection for Transliterated Content},
  author = {Selva Kumar S and Afifah Khan Mohammed Ajmal Khan and Chirag Manjeshwar and Imadh Ajaz Banday},
  journal= {arXiv preprint arXiv:2401.04619},
  year   = {2024}
}

备注

4 Pages, 6 diagrams