纠正文本嵌入中的均值偏差:一种精炼的再归一化方法及其在MMTEB上的训练-free 改进
计算与语言
2025-11-17 v1 人工智能
机器学习
摘要
我们发现当前文本嵌入模型的输出存在一致的偏差,即每个嵌入向量 可分解为 ,其中 在所有句子中几乎相同。我们提出一种即插即用、训练-free且轻量级的解决方案,称为Renormalization(再归一化)。通过大量实验,我们展示了再归一化在 Massive Multilingual Text Embedding Benchmark(MMTEB)上的性能均显著且统计显著地提升。具体而言,在检索任务上,再归一化使38个模型的性能提升达到 ;在分类任务上提升 ;在其他类型任务上提升 。再归一化包含两种变体:直接从 中减去 ,或减去 在 上的投影。我们理论上预测后者表现更好,实验结果也证实了这一预测。
关键词
引用
@article{arxiv.2511.11041,
title = {Correcting Mean Bias in Text Embeddings: A Refined Renormalization with Training-Free Improvements on MMTEB},
author = {Xingyu Ren and Youran Sun and Haoyu Liang},
journal= {arXiv preprint arXiv:2511.11041},
year = {2025}
}