中文

LDIR:基于相对表示的低维密集可解释文本嵌入

计算与语言 2025-05-19 v2

摘要

语义文本表示是自然语言处理领域的基本任务。现有文本嵌入(如SimCSE和LLM2Vec)表现优异,但每个维度的值难以追踪和解释。作为经典稀疏可解释嵌入的词袋模型(Bag-of-words)性能较差。最近,Benara等人(2024)提出了使用大型语言模型的可解释文本嵌入,基于对一系列问题的响应形成“0/1”嵌入。这些可解释文本嵌入通常是高维的(大于10,000)。本文提出了低维(小于500)密集且具有相对表示的文本嵌入(LDIR)。其维度的数值通过最远点抽样指示与不同锚文本之间的语义相关性,既提供语义表示,又具备一定的可追踪性和可解释性。我们在多个语义文本相似性、检索和聚类任务上验证了LDIR。大量实验结果表明,LDIR的性能接近黑箱基线模型,同时在维数更少的情况下优于可解释嵌入基线。代码已公开:https://github.com/szu-tera/LDIR。

关键词

引用

@article{arxiv.2505.10354,
  title  = {LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations},
  author = {Yile Wang and Zhanyu Shen and Hui Huang},
  journal= {arXiv preprint arXiv:2505.10354},
  year   = {2025}
}

备注

ACL 2025 Findings