中文

人类翻译与机器翻译中公式化语言的比较:来自议会语料的考察

计算与语言 2022-06-23 v1

摘要

最近一项研究表明,与人工翻译相比,神经机器翻译包含更多由相对高频词构成的强关联公式化序列,但由相对罕见词构成的强关联公式化序列却少得多。这些结果基于质量报纸文章的翻译得出,其中人工翻译可被认为不太直译。本研究尝试使用议会语料复现该工作。文本由三种知名神经机器翻译系统从法语译为英语:DeepL、Google Translate 和 Microsoft Translator。结果证实了在新闻语料上的观察,但差异较弱。它们表明,在比较人工与机器翻译时,使用通常导致更直译的文本体裁(如议会语料)可能更可取。关于三种神经机器系统之间的差异,似乎 Google 翻译比 DeepL 和 Microsoft 翻译含有更少的由 CollGram 技术识别的高搭配二元组。

关键词

引用

@article{arxiv.2206.10919,
  title  = {Comparing Formulaic Language in Human and Machine Translation: Insight from a Parliamentary Corpus},
  author = {Yves Bestgen},
  journal= {arXiv preprint arXiv:2206.10919},
  year   = {2022}
}

备注

Presented at ParlaCLARIN III: Workshop on Creating, Enriching and Using Parliamentary Corpora