一词不够:简单提示提升词嵌入
计算与语言
2025-12-09 v1
摘要
文本嵌入模型设计用于句子级应用,如检索和语义相似度,主要在句子级基准测试上进行评估。其在孤立单词上的行为鲜有了解。我们展示,通过在单词前添加语义提示即可显著提升词相似度相关性。测试了7个文本嵌入模型,包括 text-embedding-3-large(OpenAI)、embed-english-v3.0(Cohere)、voyage-3(Voyage AI)、all-mpnet-base-v2 和 Qwen3-Embedding-8B,在 3 个标准基准测试(SimLex-999、WordSim-353、MEN-3000)上,我们发现类似 "meaning: {word}" 或 "Represent the semantic concept: {word}" 的提示可使 SimLex-999 的 Spearman 相关性提升最高达 +0.29。一些模型在裸单词上完全失效(相关性为 0),但在添加提示后恢复(提升 +0.73)。我们的最佳结果在 SimLex-999 上使用 embed-english-v3.0(Cohere)实现相关性 = 0.692,在 WordSim-353 上实现相关性 = 0.811,在 MEN-3000 上使用 text-embedding-3-large(OpenAI)实现相关性 = 0.855。这些结果超越了 Word2Vec 等经典静态嵌入(相关性 = 0.40),甚至优于最佳静态方法 LexVec(相关性 = 0.48),在纯嵌入方法中建立了新的最佳记录。该零样本技术无需训练,可与任何文本嵌入模型一起使用。
关键词
引用
@article{arxiv.2512.06744,
title = {One Word Is Not Enough: Simple Prompts Improve Word Embeddings},
author = {Rajeev Ranjan},
journal= {arXiv preprint arXiv:2512.06744},
year = {2025}
}