中文

面向含多词表达式神经机器翻译的汉字分解

计算与语言 2021-04-12 v1 机器学习

摘要

汉字分解已被用作增强机器翻译(MT)模型的特征,将部首组合到字符和词级模型中。近期工作研究了表意文字或笔画级嵌入。然而,关于最适合 MT 的汉字表示(部首与笔画)的不同分解层级问题仍悬而未决。为详细考察汉字分解嵌入(即部首、笔画及中间层级)的影响,以及这些分解在多大程度上表征原始字符序列的含义,我们结合 MT 的自动化与人工评估开展了分析。此外,我们考察了分解的多词表达式(MWEs)的组合是否能增强模型学习。MWE 融入 MT 已有十余年探索,但分解的 MWE 此前尚未被研究。

关键词

引用

@article{arxiv.2104.04497,
  title  = {Chinese Character Decomposition for Neural MT with Multi-Word Expressions},
  author = {Lifeng Han and Gareth J. F. Jones and Alan F. Smeaton and Paolo Bolzoni},
  journal= {arXiv preprint arXiv:2104.04497},
  year   = {2021}
}

备注

Accepted to publish in NoDaLiDa2021