中文

罗马什语言变体的Mediomatix语料库:通过可比较的教科书构建平行数据

计算与语言 2026-02-16 v2

摘要

罗马什语言的五个方言(即变体)在很大程度上都经过标准化,并在各自社区的学校中进行教学。本文介绍了罗马什方言的第一个平行语料库。该语料库基于291本教科书,这些教科书在五个方言的内容上是可比较的。我们使用自动对齐方法从教科书中提取出20.7k个多平行片段,总计超过200万个标记。小规模的人工评估确认,这些片段高度平行,使数据集适用于诸如在罗马什方言之间进行机器翻译等NLP应用。我们在CC-BY-NC-SA许可下发布该语料库的平行版本和未对齐版本,并通过在数据集上训练和评估LLM和受监督的多语言MT模型,展示了其实用性。

关键词

引用

@article{arxiv.2508.16371,
  title  = {The Mediomatix Corpus: Parallel Data for Romansh Language Varieties via Comparable Schoolbooks},
  author = {Zachary Hopton and Jannis Vamvas and Andrin Büchler and Anna Rutkiewicz and Rico Cathomas and Rico Sennrich},
  journal= {arXiv preprint arXiv:2508.16371},
  year   = {2026}
}