中文

双向中文和英文被动句数据集用于机器翻译

计算与语言 2026-03-17 v1 数据库

摘要

机器翻译(MT)评估正逐渐超越指标,转向更具体的语言现象。就英中语言对而言,被动句的构建方式因语言差异而异,因此需要在机器翻译中特别关注。本文提出了一个双向多域被动句数据集,从五个中文-英平行语料库中提取句子,并根据人类翻译自动添加结构标签,同时提供一个经过人工验证注释的测试集。数据集包含73,965对平行句子(2,358,731个英文单词,3,498,229个中文字符)。我们对两种最先进的开源MT系统和四个商业模型进行评估。结果表明,与人类不同,模型更受源文本语态的影响,而非源语言中语态的总体使用方式,因此倾向于在两种方向上保持被动语态。然而,模型展现出对中文被动句中低频且主要消极语境的了解,导致在英到中翻译中语态一致性更高于中到英翻译。商业NMT模型在指标评估中得分更高,但LLM在使用多样化备选翻译方面表现更好。数据集和注释脚本将在请求后共享。

关键词

引用

@article{arxiv.2603.15227,
  title  = {Bidirectional Chinese and English Passive Sentences Dataset for Machine Translation},
  author = {Xinyue Ma and Pol Pastells and Mireia Farrús and Mariona Taulé},
  journal= {arXiv preprint arXiv:2603.15227},
  year   = {2026}
}

备注

11 pages,1 figures, Language Resources and Evaluation Conference 2026