中文

多词表达感知神经机器翻译中汉字分解的实证研究

计算与语言 2025-12-18 v1

摘要

词义、表示与解释在自然语言理解(NLU)、自然语言处理(NLP)和自然语言生成(NLG)任务中扮演基础角色。这些任务中的许多固有困难源于多词表达(MWEs),它们通过引入歧义、惯用表达、不频繁使用和广泛的变化来使任务复杂化。在解决西方语言(特别是英语)中MWEs的挑战性本质方面,已做出了大量努力并取得了实质性进展。这一进展部分归功于已建立的研究社区和丰富的计算资源。然而,对于中文及密切相关的亚洲语言家族而言,相同水平的进展并不成立,这些语言在此方面继续落后。虽然子词建模已成功应用于许多西方语言以解决罕见词问题、改善短语理解并通过字节对编码(BPE)等技术增强机器翻译(MT),但它不能直接应用于中文等表意文字语言脚本。在本工作中,我们系统地研究了MWE感知神经机器翻译中的汉字分解技术。此外,我们报告了实验,以检验汉字分解技术如何有助于表示中文单词和字符的原始含义,以及它如何有效应对翻译MWEs的挑战。

关键词

引用

@article{arxiv.2512.15556,
  title  = {An Empirical Study on Chinese Character Decomposition in Multiword Expression-Aware Neural Machine Translation},
  author = {Lifeng Han and Gareth J. F. Jones and Alan F. Smeaton},
  journal= {arXiv preprint arXiv:2512.15556},
  year   = {2025}
}

备注

capstone work, technical report, 27 pages, extraction from PhD thesis https://doras.dcu.ie/26559/