更少即更多:针对低资源语言的文本嵌入适配器与小规模噪声合成数据
计算与语言
2026-03-25 v1 信息检索
摘要
低资源语言(LRL)常缺乏高质量、大规模数据集用于训练有效的文本嵌入模型,阻碍了其在检索增强生成(RAG)和语义搜索等任务中的应用。本文挑战了“有效的语义对齐需要大规模数据或干净的人工验证翻译”这一主流假设。我们聚焦阿尔美尼亚语(一种稀缺资源且拥有独特文字的语言),引入一种成本效益高的适配策略,使用通过开源权重模型翻译的英文Reddit标题-正文对生成的少量噪声合成数据。我们建立了全面的评估基准,包括现有数据集、翻译后数据和手动筛选的数据集。我们的实验揭示了惊人的“更少即更多”现象:仅使用10,000条噪声合成对,在基准测试上的平均提升达11-12%,在检索性能上实现20%以上的相对提升,性能媲美在约100万个示例上训练的模型。此外,我们证明了无论是增加数据规模、通过最先进的LLM改进翻译质量,还是多样化数据领域,均未显著超过此最小基线。我们在另一种稀缺资源且文字独特的语言上验证了这些发现的普遍性。我们的结果表明,LRL的语义对齐早期即饱和且对噪声高度稳健, democrat化了资源受限社区中高性能嵌入的创建。我们将发布模型、数据和基准测试,网址为 https://metric-ai-lab.github.io/less-is-more-embeddings/。
引用
@article{arxiv.2603.22290,
title = {Less is More: Adapting Text Embeddings for Low-Resource Languages with Small Scale Noisy Synthetic Data},
author = {Zaruhi Navasardyan and Spartak Bughdaryan and Bagrat Minasyan and Hrant Davtyan},
journal= {arXiv preprint arXiv:2603.22290},
year = {2026}
}
备注
Accepted at LoResLM 2026, EACL 2026 Workshop