基于 BERT 的双嵌入模型用于中文成语预测
计算与语言
2020-11-05 v1
摘要
中文成语是通常源自古代故事的特定固定短语,其含义往往高度习语化且不可组合。中文成语预测任务是在给定带空白的上下文时,从一组候选成语中选出正确的成语。我们提出一种基于 BERT 的双嵌入模型,以编码上下文词语并学习成语的双重嵌入。具体而言,我们首先将每个候选成语的嵌入与上下文中对应空白的隐藏表示进行匹配;随后通过上下文池化将每个候选成语的嵌入与上下文中所有词元的隐藏表示进行匹配。我们进一步提出为这两类匹配使用两个独立的成语嵌入。在近期发布的中文成语完形填空数据集上的实验表明,我们所提方法的性能优于现有最优方法。消融实验也显示,上下文池化与双嵌入均有助于性能提升。
引用
@article{arxiv.2011.02378,
title = {A BERT-based Dual Embedding Model for Chinese Idiom Prediction},
author = {Minghuan Tan and Jing Jiang},
journal= {arXiv preprint arXiv:2011.02378},
year = {2020}
}
备注
COLING 2020