它能否被拆解?
计算与语言
2020-09-22 v1 人工智能
摘要
自然语言处理系统常常难以处理未登录词(OOV),即未出现在训练数据中的词项。混成词(如“innoventor”)是一类尤其具有挑战性的OOV,因为它们以不可预测的方式和程度融合两个或多个与预期含义相关的词基而成。在这项工作中,我们在全新的英语OOV混成词数据集上开展实验,以量化BERT等大规模上下文语言模型解读混成词含义的困难程度。我们首先表明,BERT对这些混成词的处理并未充分获取组分含义,使其上下文表示在语义上贫乏。我们发现这主要归因于混成词形成所导致的字符丢失。随后,我们评估不同模型识别混成词结构并还原其来源的难度,发现上下文感知嵌入系统优于字符级和上下文无关嵌入,尽管其结果仍远不能令人满意。
引用
@article{arxiv.2009.09123,
title = {Will it Unblend?},
author = {Yuval Pinter and Cassandra L. Jacobs and Jacob Eisenstein},
journal= {arXiv preprint arXiv:2009.09123},
year = {2020}
}
备注
Findings of EMNLP 2020