中文

低资源机器翻译:为了什么?为了谁?关于专用Tetun语翻译服务的观察研究

计算与语言 2025-06-10 v4 人工智能

摘要

低资源机器翻译(MT)呈现出多样化的社区需求和应用挑战,这些仍未被充分理解。为了补充通常依赖小样本受访者的调查和焦点小组,我们提出了一项关于tetun..org实际使用模式的观察研究,这是一个针对Tetun语(东帝汶的通用语)的专用MT服务。我们对100,000个翻译请求的分析揭示了挑战基于现有语料库假设的模式。我们发现用户(其中许多是使用移动设备的学生)通常将文本从高资源语言翻译成Tetun语,涵盖科学、医疗保健和日常生活等多个领域。这与现有的Tetun语语料库形成鲜明对比,后者主要由涵盖政府和社会问题的新闻文章主导。我们的结果表明,对于像Tetun语这样的制度化少数民族语言,MT系统应优先考虑与教育背景相关的领域在高资源到低资源方向上的准确性。更广泛地说,这项研究展示了观察分析如何通过将研究植根于实际社区需求来指导低资源语言技术开发。

关键词

引用

@article{arxiv.2411.12262,
  title  = {Low-resource Machine Translation: what for? who for? An observational study on a dedicated Tetun language translation service},
  author = {Raphael Merx and Adérito José Guterres Correia and Hanna Suominen and Ekaterina Vylomova},
  journal= {arXiv preprint arXiv:2411.12262},
  year   = {2025}
}

备注

to be published in LoResMT 2025