Compass-Embedding v4:面向多语言电商嵌入的鲁棒对比学习
计算与语言
2026-01-21 v1 人工智能
摘要
随着全球电商快速向新兴市场扩张,低资源语言缺乏高质量的语义表示已成为检索、推荐和搜索系统的决定性瓶颈。在这项工作中,我们提出了 Compass-Embedding v4,这是一个专门针对东南亚(SEA)电商场景优化的高效多语言嵌入框架,在这些场景中,数据稀缺、噪声监督和严格的生产约束共同挑战着表示学习。Compass-Embedding v4 应对三个核心挑战。首先,混合任务监督下的大批量对比训练引入了系统性的假负样本,这会降低语义对齐。我们提出了类感知掩码(CAM),对 InfoNCE 目标的一种轻量级修改,它在不改变训练效率的情况下抑制无效的批内负样本并改善语义判别。其次,低资源东南亚语言的数据覆盖有限且不均衡。我们通过基于上下文的合成数据生成、跨语言翻译和结构化电商数据构建,构建了多样化的训练语料库,实现了鲁棒的多语言和特定领域学习。第三,生产部署要求在保持嵌入质量的同时实现高吞吐量推理。我们将鲁棒性驱动的大批量训练与球面模型合并相结合以缓解灾难性遗忘,并通过 vLLM 和 FP8 量化优化推理。在多语言基准和专有电商任务上的广泛评估表明,Compass-Embedding v4 在主要东南亚语言上实现了最先进的性能,在特定领域的检索和分类中显著优于通用嵌入模型,同时在高资源语言上保持了具有竞争力的性能。
引用
@article{arxiv.2601.11565,
title = {Compass-Embedding v4: Robust Contrastive Learning for Multilingual E-commerce Embeddings},
author = {Pakorn Ueareeworakul and Shuman Liu and Jinghao Feng and Ling Hu and Zhantang Shi and Chengqi Sun and Liang Yao and Panyi Ouyang and Haibo Zhang and Anxiang Zeng},
journal= {arXiv preprint arXiv:2601.11565},
year = {2026}
}