Glyce:用于汉字表示的字形向量
计算与语言
2020-05-22 v5 人工智能
计算机视觉与模式识别
摘要
直观而言,像中文这样的语素文字的 NLP 任务应受益于这些语言中字形信息的使用。然而,由于字形中缺乏丰富的象形证据,以及标准计算机视觉模型在字符数据上泛化能力较弱,一种利用字形信息的有效方法仍有待发现。本文通过提出 Glyce(用于汉字表示的字形向量)来弥补这一缺口。我们做了三项主要创新:(1) 我们使用历史汉字字体(如金文、篆书、繁体中文等)来丰富字符中的象形证据;(2) 我们设计了专为汉字图像处理的 CNN 结构(称为田字格-CNN);(3) 我们在多任务学习设置中使用图像分类作为辅助任务,以提升模型的泛化能力。我们表明,基于字形的模型能够在广泛的中文 NLP 任务中持续优于基于词/字 ID 的模型。我们能够在多种中文 NLP 任务上确立新的 SOTA 结果,包括标注(NER、CWS、POS)、句子对分类、单句分类任务、依存句法分析和语义角色标注。例如,所提模型在 OntoNotes 的 NER 数据集上取得 80.6 的 F1 分数,较 BERT 高出 1.5;它在 Fudan 语料库文本分类上取得近乎完美的 99.8% 准确率。代码见 https://github.com/ShannonAI/glyce。
引用
@article{arxiv.1901.10125,
title = {Glyce: Glyph-vectors for Chinese Character Representations},
author = {Yuxian Meng and Wei Wu and Fei Wang and Xiaoya Li and Ping Nie and Fan Yin and Muyu Li and Qinghong Han and Xiaofei Sun and Jiwei Li},
journal= {arXiv preprint arXiv:1901.10125},
year = {2020}
}
备注
Accepted by NeurIPS 2019