GlyphCRM:基于汉字字形双向编码器表示
人工智能
2021-07-02 v1 计算与语言
计算机视觉与模式识别
摘要
已有工作表明,汉字字形包含丰富的语义信息,并有潜力增强汉字的表示。利用字形特征的典型方法是将其融入字符嵌入空间。受先前方法启发,我们创新性地提出了一种名为 GlyphCRM 的中文预训练表示模型,其摒弃了基于 ID 的字符嵌入方法,仅基于序列化字符图像。我们将每个字符渲染为二值灰度图像,并为其设计双通道位置特征图。形式上,我们首先设计一个两层残差卷积神经网络,即 HanGlyph,以生成汉字的初始字形表示,随后采用多个双向编码器 Transformer 模块作为上层结构以捕获上下文敏感信息。同时,我们通过跳跃连接方法将 HanGlyph 模块各层提取的字形特征送入底层 Transformer 模块,以充分利用汉字字形特征。由于 HanGlyph 模块可获取任意汉字的充分字形表示,长期存在的未登录词问题可得以有效解决。大量实验结果表明,GlyphCRM 在 9 个微调任务上大幅优于先前基于 BERT 的 SOTA 模型,且在专业领域与低资源任务上具有强迁移性与泛化性。我们希望本工作能激发超越既定中文文本表示范畴的进一步研究。
引用
@article{arxiv.2107.00395,
title = {GlyphCRM: Bidirectional Encoder Representation for Chinese Character with its Glyph},
author = {Yunxin Li and Yu Zhao and Baotian Hu and Qingcai Chen and Yang Xiang and Xiaolong Wang and Yuxin Ding and Lin Ma},
journal= {arXiv preprint arXiv:2107.00395},
year = {2021}
}
备注
11 pages, 7 figures