中文

测量文本中的分布偏移:基于语言模型的嵌入之优势

计算与语言 2023-12-06 v1

摘要

在生产环境中监控机器学习模型的一个关键部分是测量输入和输出数据漂移。在本文中,我们提出了一个用于测量自然语言数据中分布偏移的系统,并重点研究和探讨了使用大语言模型解决此问题的潜在优势。LLMs 的最新进展及其在不同领域的成功应用表明,它们在捕获语义关系以解决各种自然语言处理问题方面非常有效。LLMs 的能力很大程度上来源于相应神经网络隐藏层中生成的编码(嵌入)。首先,我们提出了一种基于聚类的算法,通过利用此类嵌入来测量文本数据中的分布偏移。然后,我们研究了我们的方法应用于由 LLMs 和经典嵌入算法生成的文本嵌入时的有效性。我们的实验表明,与其他嵌入方法相比,基于通用 LLM 的嵌入对数据漂移具有高敏感度。我们提出将漂移敏感度作为比较语言模型时需要考虑的重要评估指标。最后,我们分享了将我们的框架作为 Fiddler ML 监控平台一部分部署 18 个月所获得的见解和经验教训。

关键词

引用

@article{arxiv.2312.02337,
  title  = {Measuring Distributional Shifts in Text: The Advantage of Language Model-Based Embeddings},
  author = {Gyandev Gupta and Bashir Rastegarpanah and Amalendu Iyer and Joshua Rubin and Krishnaram Kenthapadi},
  journal= {arXiv preprint arXiv:2312.02337},
  year   = {2023}
}