中文

我们需要领域特定嵌入模型吗?一项实证研究

计算与语言 2025-02-19 v4 信息检索

摘要

嵌入模型在各种 NLP 应用的信息表示与检索中发挥着至关重要的作用。大型语言模型(LLM)的最新进展进一步提升了嵌入模型的性能,这些模型在涵盖几乎所有领域的大量文本上进行训练。这些模型通常在 Massive Text Embedding Benchmark(MTEB)等通用数据集上进行基准测试,并展现出卓越的性能。然而,一个关键问题随之产生:当通用模型在已经包含特定领域文本的海量语料上进行训练时,开发领域特定嵌入模型是否还有必要?在本文中,我们以金融领域为例对这一问题进行实证研究。我们引入了 Finance Massive Text Embedding Benchmark(FinMTEB),作为 MTEB 的对应版本,由金融领域特定的文本数据集构成。我们在 FinMTEB 上评估了七个 SOTA 嵌入模型的性能,并观察到与它们在 MTEB 上的性能相比,性能出现显著下降。为了排除这种下降是由 FinMTEB 更高的复杂性所导致的可能性,我们提出了四种度量来量化数据集复杂性,并在分析中控制了这一因素。我们的分析提供了令人信服的证据,表明 SOTA 嵌入模型难以捕捉领域特定的语言和语义模式。此外,我们发现通用嵌入模型在 MTEB 上的性能与其在 FinMTEB 上的性能不相关,这表明领域特定的嵌入模型需要领域特定的嵌入基准。本研究为 LLM 时代开发领域特定嵌入模型提供了启示。FinMTEB 的开源代码可在 https://github.com/yixuantt/FinMTEB 获取

关键词

引用

@article{arxiv.2409.18511,
  title  = {Do We Need Domain-Specific Embedding Models? An Empirical Investigation},
  author = {Yixuan Tang and Yi Yang},
  journal= {arXiv preprint arXiv:2409.18511},
  year   = {2025}
}

备注

https://github.com/yixuantt/FinMTEB, The newer version: arXiv:2502.10990