打破汉字表征瓶颈:基于笔画序列建模的神经机器翻译
计算与语言
2022-11-24 v1 人工智能
摘要
现有研究通常将汉字作为最小表征单元。然而,此种汉字表征会遭遇两重瓶颈:1) 学习瓶颈,学习无法受益于其丰富的内部特征(如部首与笔画);2) 参数瓶颈,每个独立汉字须由唯一向量表示。本文引入一种新颖的汉字表征方法以打破上述瓶颈,即StrokeNet,其通过拉丁化笔画序列表示汉字(如“ao1(凹)”表示为“ajaie”,“tu1(凸)”表示为“aeaqe”)。具体而言,StrokeNet将每类笔画映射至特定拉丁字符,从而使相似汉字具有相似拉丁表示。将StrokeNet引入神经机器翻译(NMT)后,许多强大但此前不适用于非拉丁语言的技术(如共享子词表学习与基于密文的数据增强)现可完美实现。在广泛使用的NIST中英、WMT17中英与IWSLT17日英NMT任务上的实验表明,StrokeNet以更少模型参数显著优于强基线,在WMT17中英任务上取得26.5 BLEU,优于任何此前不使用单语数据的已报道结果。代码与脚本发布于 https://github.com/zjwang21/StrokeNet。
引用
@article{arxiv.2211.12781,
title = {Breaking the Representation Bottleneck of Chinese Characters: Neural Machine Translation with Stroke Sequence Modeling},
author = {Zhijun Wang and Xuebo Liu and Min Zhang},
journal= {arXiv preprint arXiv:2211.12781},
year = {2022}
}
备注
Accepted to EMNLP 2022