中文

机器翻译文本的训练如何影响词汇多样性与源-目标语法相似性塊形学习

计算与语言 2026-02-19 v1

摘要

机器翻译数据在多语言 NLP 中被广泛使用,尤其在本土文本稀缺的情形下。然而,机器翻译文本与本土文本存在系统性差异。这种现象称为 translationese,反映了源语言的痕迹以及翻译本身的特征。本文研究训练于机器翻译数据对小规模英语语言模型的影响,聚焦于不同来源语言的 translationese 如何塊形语言可接受性判断和语言建模。我们在来自 24 种类型学和资源多样化的来源语言的英语文本上进行训练,从而实现对来源语言与语料特性如何影响模型学习的系统性分析。我们的结果表明,来源语言对模型行为具有明确影响:一般困惑度更依赖于翻译语料的词汇多样性,而语法表现则在数据充足时与英语的类型学相似性呈强相关。

关键词

引用

@article{arxiv.2602.16469,
  title  = {Training Models on Dialects of Translationese Shows How Lexical Diversity and Source-Target Syntactic Similarity Shape Learning},
  author = {Jenny Kunz},
  journal= {arXiv preprint arXiv:2602.16469},
  year   = {2026}
}