理解合成数据对文本嵌入器的影响
计算与语言
2025-09-09 v1
摘要
近期发展文本嵌入器的通用方法,得益于在不断增长的合成LLM生成数据上进行训练。然而,目前尚无公开可用的合成数据集,构成了研究其在泛化方面作用的障碍。为此,我们首先复现并公开发布Wang等人(Mistral-E5)提出的合成数据。我们的合成数据质量高,能够在性能上实现一致的提升。接下来,我们批判性地检验了合成数据在模型泛化中的具体作用位置。我们的分析表明,合成数据带来的益处稀疏且高度局限于单个数据集;此外,我们观察到不同类别和数据上的性能之间存在权衡,某些数据对一个任务有益,却会损害另一个任务的性能。我们的发现凸显了当前合成数据方法在构建通用嵌入器方面的局限性,并挑战了训练在合成数据上可导致更稳健的跨任务嵌入模型的观念。
引用
@article{arxiv.2509.06184,
title = {Understanding the Influence of Synthetic Data for Text Embedders},
author = {Jacob Mitchell Springer and Vaibhav Adlakha and Siva Reddy and Aditi Raghunathan and Marius Mosbach},
journal= {arXiv preprint arXiv:2509.06184},
year = {2025}
}
备注
ACL Findings 2025