理解词嵌入的下游不稳定性
计算与语言
2020-03-12 v1 机器学习
机器学习
摘要
许多工业机器学习(ML)系统需要频繁重新训练以跟上不断变化的数据。这种重新训练加剧了当今 ML 系统面临的一个巨大挑战:模型训练不稳定,即训练数据的微小变化可能导致模型预测的重大变化。在本文中,我们致力于更深入地理解这种不稳定性,重点关注现代自然语言处理(NLP)流程的核心构建块——预训练词嵌入——如何影响下游 NLP 模型的不稳定性。我们首先通过实证揭示了一种稳定性与内存之间的权衡:将嵌入内存增加 2 倍可使因训练数据微小变化导致的预测不一致减少 5% 至 37%(相对值)。为从理论上解释这一权衡,我们引入了一种新的嵌入不稳定性度量——特征空间不稳定性度量(eigenspace instability measure)——我们证明它界定了由词嵌入变化引起的下游预测不一致。在实践中,我们表明特征空间不稳定性度量可以是一种经济高效的方式,用于选择嵌入参数以最小化不稳定性而无需训练下游模型,其优于其他嵌入距离度量,并与基于最近邻的度量表现相当。最后,我们证明所观察到的稳定性-内存权衡也扩展到其他类型的嵌入,包括知识图谱和上下文词嵌入。
引用
@article{arxiv.2003.04983,
title = {Understanding the Downstream Instability of Word Embeddings},
author = {Megan Leszczynski and Avner May and Jian Zhang and Sen Wu and Christopher R. Aberger and Christopher Ré},
journal= {arXiv preprint arXiv:2003.04983},
year = {2020}
}
备注
In Proceedings of the 3rd MLSys Conference, 2020