使用上下文词嵌入进行语义漂移的统计显著性检测
计算与语言
2022-02-23 v2
摘要
在较小数据集中检测词汇语义变化(例如在历史语言学和数字人文中)由于统计功效不足而具有挑战性。非上下文嵌入模型为每个词产生一个嵌入,从而掩盖数据中存在的变异性,加剧了这一问题。在本文中,我们提出一种通过结合上下文词嵌入与基于置换的统计检验来估计语义漂移的方法。我们使用错误发现率过程来处理同时进行的海量假设检验。我们在模拟中展示了该方法的性能,其通过抑制假阳性实现了持续的高精度。我们还分析了来自SemEval-2020 Task 1和Liverpool FC子版块语料库的真实数据。我们表明,通过考虑样本变异,我们可以在不降低整体性能的情况下提高个体语义漂移估计的鲁棒性。
引用
@article{arxiv.2104.03776,
title = {Statistically significant detection of semantic shifts using contextual word embeddings},
author = {Yang Liu and Alan Medlar and Dorota Glowacka},
journal= {arXiv preprint arXiv:2104.03776},
year = {2022}
}