中文

通过跨语言分词器手术和离线蒸馏适配多语言嵌入模型以适用于土耳其语

计算与语言 2026-05-29 v1

摘要

句子嵌入是语义搜索、聚类、分类和检索增强生成的基础组件。本文提出了 embeddingmagibu-200m,这是一个专注于土耳其语的句子嵌入模型,产生 768 维的 L2 归一化向量,支持 8192 token 的上下文窗口,远超 earlier BERT 基于土耳其语编码器的 512 token 限制。不进行完整预训练,本文引入一种高效的三阶段适应流程:(1)构建一个针对土耳其语优化的多语言分词器,拥有 131072 的词汇表,通过修剪教师词汇表中的冗余 token 并纳入多语言 token 进行 40 语种语料的频率分析;(2)克隆教师嵌入模型,保留 transformer backbone 权重,并通过均值组合 token 映射初始化与新词汇表兼容的嵌入表;(3)使用余弦相似度目标对预计算的教师向量进行离线嵌入蒸馏,语料为 40 语种维基百科语料库。 resulting student model 包含约 200M 参数,在单块 GPU 上约 4 小时即可完成训练,总成本为 5-20 美元。经验上,在 STSbTR 上获得了 77.55%/77.45% 的 Pearson/Spearman 相关性,超越了 300M 参数的教师模型 (73.84%/72.92%)。在 TR-MTEB (26 项任务) 上,获得了 63.9% 的平均得分 (排名第 7/26),在 33% 更少的参数下提供了具竞争力的 cost-quality trade-off。为便于可重复性和下游使用,所有制品均已发布,包括模型权重、分词器文件、预计算嵌入数据集以及开源克隆和蒸馏工具。

关键词

引用

@article{arxiv.2605.29992,
  title  = {Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation},
  author = {M. Ali Bayram and Banu Diri and Savaş Yıldırım},
  journal= {arXiv preprint arXiv:2605.29992},
  year   = {2026}
}

备注

14 pages, 2 figures, 4 tables, Appendix included