中文

基于提示的文本嵌入的冗余性、各向同性与本征维数

计算与语言 2025-06-03 v1

摘要

基于提示的文本嵌入模型在接收到定制提示后会生成特定任务的嵌入,近期展现出了卓越的性能。然而,其生成的嵌入通常具有数千个维度,导致高存储成本以及基于嵌入的操作的计算成本增加。在本文中,我们研究了事后应用于嵌入的降维操作如何影响利用这些嵌入的各种任务的性能,具体包括分类、聚类、检索和语义文本相似度(STS)任务。我们的实验表明,即使是仅保留嵌入前25%维度的朴素降维方法,也只会导致非常轻微的性能下降,这表明这些嵌入具有高度冗余性。值得注意的是,对于分类和聚类任务,即使将嵌入降至原始维度的不到0.5%,性能下降也非常小。为了定量分析这种冗余性,我们基于嵌入的本征维数和各向同性进行了分析。我们的分析揭示,与检索和STS任务的嵌入相比,被认为具有极高维度冗余的分类和聚类任务的嵌入表现出更低的本征维数和更弱的各向同性。

关键词

引用

@article{arxiv.2506.01435,
  title  = {Redundancy, Isotropy, and Intrinsic Dimensionality of Prompt-based Text Embeddings},
  author = {Hayato Tsukagoshi and Ryohei Sasano},
  journal= {arXiv preprint arXiv:2506.01435},
  year   = {2025}
}

备注

ACL 2025 Findings