AyutthayaAlpha:面向泰-拉丁脚本音译的 Transformer 模型
计算与语言
2024-12-06 v1 人工智能
摘要
本研究介绍AyutthayaAlpha,这是一个面向泰语专有名词音译为拉丁脚本的高级基于Transformer的机器学习模型。该系统以82.32%的一级token准确率和95.24%的一三级token准确率实现领先性能,同时保持低0.0047的字符错误率。泰语语音学中包括声调特征和元音长度区分的复杂性,为准确音译带来了显著挑战。我们通过一种新颖的两模型方法来解决这些挑战:基于ByT5架构的AyutthayaAlpha-Small,以及意外超越其较大版本的AyutthayaAlpha-VerySmall——一个计算效率更高的变体。我们的研究将语言学规则与深度学习相结合,在由精心策划的120万个泰-拉丁名称对数据集上训练,通过战略性上采样扩充至270万个示例。广泛的评估表明,AyutthayaAlpha不仅在准确性方面取得优异成绩,还有效地捕捉了个人和文化偏好在名称罗马化中的体现。该系统的实际应用扩展到跨语言信息检索、国际数据标准化和身份验证系统,尤其适用于政府数据库、学术机构和全球企业运营。本工作在尊重名称音译的文化和个人维度的同时,显著推进了泰语与拉丁脚本之间的语言鸿沟。
关键词
引用
@article{arxiv.2412.03877,
title = {AyutthayaAlpha: A Thai-Latin Script Transliteration Transformer},
author = {Davor Lauc and Attapol Rutherford and Weerin Wongwarawipatr},
journal= {arXiv preprint arXiv:2412.03877},
year = {2024}
}