中文

解码英中新闻文本中的机器翻译语素:LLM 与 NMT 的比较

计算与语言 2025-06-30 v1

摘要

本研究探讨了机器翻译语素(MTese)——即机器翻译输出的语言特征,聚焦于较少研究的英译汉语言对的新闻文本。我们构建了一个由4个子语料库组成的大型数据集,并采用全面的五层特征集合。随后,对分类与聚类任务中的特征进行卡方排序算法的特征选择。我们的发现确认了MTese在神经机器翻译系统(NMT)和大型语言模型(LLM)中的存在。原始中文文本几乎能被完美地区分于LLM和NMT输出。MT输出的显著语言模式包括 shorter 句子长度和增加的对抗连词使用。比较LLM与NMT,我们实现了约70%的分类准确率,LLM表现出更大的词汇多样性,而NMT使用的括号更多。此外,对比特定翻译的LLM与通用LLM,后者的词汇多样性更低,但使用因果连词更多。最后,我们发现中外公司开发的LLM之间不存在显著差异。

关键词

引用

@article{arxiv.2506.22050,
  title  = {Decoding Machine Translationese in English-Chinese News: LLMs vs. NMTs},
  author = {Delu Kong and Lieve Macken},
  journal= {arXiv preprint arXiv:2506.22050},
  year   = {2025}
}

备注

14 pages, 5 figures, 6 tables. Accpeted in MT Summit 2025, Research: Technical track. Official version may be accessed later in the ACL Anthology