MICE:利用上下文嵌入挖掘习语
计算与语言
2021-11-11 v2 机器学习
摘要
习语表达对其构成词的意义无法推断,这给自然语言处理应用带来了问题。缺乏成功的方法途径和足够大的数据集阻碍了用于检测习语的机器学习方法的发展,尤其是对于未在训练集中出现的表达。我们提出了一种称为 MICE 的方法,利用上下文嵌入来实现该目的。我们提出了一个包含字面意义和习语意义的多词表达新数据集,并用它来训练基于两种最先进的上下文词嵌入(ELMo 和 BERT)的分类器。我们表明,使用这两种嵌入的深度神经网络性能远优于现有方法,并且能够检测习语性用词,即便对于训练集中未出现的表达也是如此。我们展示了所开发模型的跨语言迁移能力,并分析了所需数据集的规模。
引用
@article{arxiv.2008.05759,
title = {MICE: Mining Idioms with Contextual Embeddings},
author = {Tadej Škvorc and Polona Gantar and Marko Robnik-Šikonja},
journal= {arXiv preprint arXiv:2008.05759},
year = {2021}
}