中文

纠正文本嵌入中的均值偏差:一种精炼的再归一化方法及其在MMTEB上的训练-free 改进

计算与语言 2025-11-17 v1 人工智能 机器学习

摘要

我们发现当前文本嵌入模型的输出存在一致的偏差,即每个嵌入向量 ee 可分解为 e~+μ\tilde{e} + \mu,其中 μ\mu 在所有句子中几乎相同。我们提出一种即插即用、训练-free且轻量级的解决方案,称为Renormalization(再归一化)。通过大量实验,我们展示了再归一化在 Massive Multilingual Text Embedding Benchmark(MMTEB)上的性能均显著且统计显著地提升。具体而言,在检索任务上,再归一化使38个模型的性能提升达到 9.7σ9.7 \sigma;在分类任务上提升 3.1σ3.1 \sigma;在其他类型任务上提升 0.8σ0.8 \sigma。再归一化包含两种变体:直接从 ee 中减去 μ\mu,或减去 eeμ\mu 上的投影。我们理论上预测后者表现更好,实验结果也证实了这一预测。

关键词

引用

@article{arxiv.2511.11041,
  title  = {Correcting Mean Bias in Text Embeddings: A Refined Renormalization with Training-Free Improvements on MMTEB},
  author = {Xingyu Ren and Youran Sun and Haoyu Liang},
  journal= {arXiv preprint arXiv:2511.11041},
  year   = {2025}
}