说文解字:重新思考中文语言预训练中的字典与字形
计算与语言
2023-05-31 v1
摘要
我们引入 CDBERT,一种利用字典知识与汉字结构增强中文预训练语言模型(PLMs)语义理解能力的新学习范式。我们将 CDBERT 的两个核心模块命名为 Shuowen 与 Jiezi,其中 Shuowen 指从汉语字典中检索最合适义项的过程,Jiezi 指通过结构理解增强字符字形表示的过程。为促进字典理解,我们提出三个预训练任务,即掩码条目建模、同义词与反义词对比学习,以及例证学习。我们在现代中文理解基准 CLUE 与古中文基准 CCLUE 上评估了我们的方法。此外,我们基于收集的古汉语字典提出一个新的多义判别任务 PolyMRC。我们的范式在所有任务上相对于先前中文 PLMs 均展现出一致提升。并且,我们的方法在古中文理解的少样本设定下带来显著增强。
引用
@article{arxiv.2305.18760,
title = {Shuo Wen Jie Zi: Rethinking Dictionaries and Glyphs for Chinese Language Pre-training},
author = {Yuxuan Wang and Jianghui Wang and Dongyan Zhao and Zilong Zheng},
journal= {arXiv preprint arXiv:2305.18760},
year = {2023}
}
备注
To appear at ACL 2023 Findings