阿罗马尼亚语的方言与低资源机器翻译
计算与语言
2025-01-08 v2
摘要
本文介绍了构建一个支持英语、罗马尼亚语和阿罗马尼亚语(一种濒危的东罗曼语)的神经机器翻译系统的过程。本研究的主要贡献有两方面:(1)创建了迄今为止最广泛的阿罗马尼亚语-罗马尼亚语平行语料库,包含79,000个句子对;(2)开发并比较分析了多个针对阿罗马尼亚语优化的机器翻译模型。为此,我们引入了一套辅助工具,包括一个用于文本挖掘和自动评估的与语言无关的句子嵌入模型,以及一个针对不同书写标准的变音符号转换系统。本研究通过为一种历史上资源匮乏的语言建立必要资源,为计算语言学和语言保护工作做出了贡献。所有数据集、训练好的模型和相关工具均已公开:https://huggingface.co/aronlp 和 https://arotranslate.com
引用
@article{arxiv.2410.17728,
title = {Dialectal and Low-Resource Machine Translation for Aromanian},
author = {Alexandru-Iulius Jerpelea and Alina Rădoi and Sergiu Nisioi},
journal= {arXiv preprint arXiv:2410.17728},
year = {2025}
}
备注
Accepted at COLING 2025