LDIR:基于相对表示的低维密集可解释文本嵌入
计算与语言
2025-05-19 v2
摘要
语义文本表示是自然语言处理领域的基本任务。现有文本嵌入(如SimCSE和LLM2Vec)表现优异,但每个维度的值难以追踪和解释。作为经典稀疏可解释嵌入的词袋模型(Bag-of-words)性能较差。最近,Benara等人(2024)提出了使用大型语言模型的可解释文本嵌入,基于对一系列问题的响应形成“0/1”嵌入。这些可解释文本嵌入通常是高维的(大于10,000)。本文提出了低维(小于500)密集且具有相对表示的文本嵌入(LDIR)。其维度的数值通过最远点抽样指示与不同锚文本之间的语义相关性,既提供语义表示,又具备一定的可追踪性和可解释性。我们在多个语义文本相似性、检索和聚类任务上验证了LDIR。大量实验结果表明,LDIR的性能接近黑箱基线模型,同时在维数更少的情况下优于可解释嵌入基线。代码已公开:https://github.com/szu-tera/LDIR。
引用
@article{arxiv.2505.10354,
title = {LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations},
author = {Yile Wang and Zhanyu Shen and Hui Huang},
journal= {arXiv preprint arXiv:2505.10354},
year = {2025}
}
备注
ACL 2025 Findings