利用文档嵌入与降维检测文本数据中的协变量漂移
机器学习
2023-09-20 v1 计算与语言
摘要
检测文本数据中的协变量漂移对于维持文本分析模型的可靠性与性能至关重要。在本研究中,我们考察了不同文档嵌入、降维技术与漂移检测方法在识别文本数据协变量漂移中的有效性。我们探讨了三种流行的文档嵌入:采用潜在语义分析(LSA)降维的词频-逆文档频率(TF-IDF)与 Doc2Vec,以及 BERT 嵌入,并分别考察了使用与不使用主成分分析(PCA)降维的情形。为量化训练与测试数据分布间的差异,我们采用 Kolmogorov-Smirnov(KS)统计量与最大均值差异(MMD)检验作为漂移检测方法。实验结果表明,特定的嵌入、降维技术与漂移检测方法组合在检测协变量漂移上优于其他组合。我们的发现通过提供应对文本数据协变量漂移有效方法的见解,推动了可靠文本分析模型的发展。
引用
@article{arxiv.2309.10000,
title = {Detecting covariate drift in text data using document embeddings and dimensionality reduction},
author = {Vinayak Sodar and Ankit Sekseria},
journal= {arXiv preprint arXiv:2309.10000},
year = {2023}
}