中文

带不完整输入的阿卜卡达脚本音节序列重建

计算与语言 2025-05-19 v1 机器学习

摘要

本文探讨了阿卜卡达语言音节序列预测问题,聚焦于六种语言:孟加拉、印地语、柬埔寨、老挝、缅甸和泰语,来自亚洲语言树系(ALT)数据集。我们研究了从各种不完整输入类型(包括辅音序列、元音序列、部分音节(随机字符删除)和掩码音节(固定音节删除))中重建完整音节序列的能力。我们的实验结果表明,辅音序列在准确预测音节方面起关键作用,取得高 BLEU 分数,而元音序列则面临更大的挑战。该模型在各项任务中表现稳健,尤其在处理部分和掩码音节重建方面表现突出,针对涉及辅音信息和音节遮盖的任务取得了优异成绩。该研究推进了阿卜卡达语言序列预测的理解,为诸如文本预测、拼写纠正和数据增强等应用提供了实用见解。

关键词

引用

@article{arxiv.2505.11008,
  title  = {Reconstructing Syllable Sequences in Abugida Scripts with Incomplete Inputs},
  author = {Ye Kyaw Thu and Thazin Myint Oo},
  journal= {arXiv preprint arXiv:2505.11008},
  year   = {2025}
}

备注

14 pages, 2 figures, 6 tables, 1 listing