中文

作为文本嵌入自监督训练的数据增强策略,裁剪优于 dropout

计算与语言 2026-03-17 v2 机器学习

摘要

文本嵌入,即整个文本的向量表示,在许多 NLP 应用中发挥着重要作用,例如检索增强生成、聚类,或为数据探索可视化文本集合。目前,表现最佳的嵌入模型是通过监督对比微调从预训练语言模型中导出的。这种微调策略依赖于外部的相似性概念和用于生成正样本对的标注数据。在此,我们研究了自监督微调,并系统比较了用于微调文本嵌入模型的两种最著名的数据增强策略。我们在 MTEB 和额外的领域内评估上评估了嵌入质量,并表明裁剪增强明显优于基于 dropout 的方法。我们发现,在域外数据上,所得嵌入的质量大大低于监督最先进模型,但对于域内数据,自监督微调可以在极短的微调后产生高质量的文本嵌入。最后,我们表明表示质量在最后的 Transformer 层有所提升,这些层在微调期间经历了最大的变化;并且仅微调这些最后几层就足以达到相似的嵌入质量。

关键词

引用

@article{arxiv.2508.03453,
  title  = {Cropping outperforms dropout as an augmentation strategy for self-supervised training of text embeddings},
  author = {Rita González-Márquez and Philipp Berens and Dmitry Kobak},
  journal= {arXiv preprint arXiv:2508.03453},
  year   = {2026}
}