中文

超越指令条件化,MoTE:面向多任务嵌入模型的任务专家混合

机器学习 2025-06-24 v1 计算与语言

摘要

稠密嵌入是现代机器学习系统的基础,为检索增强生成 (RAG)、信息检索和表示学习提供支持。虽然指令条件化已成为嵌入专业化的主导方法,但将其直接应用于低容量模型会施加根本的表示约束,从而限制专业化带来的性能提升。在本文中,我们分析了这些局限性,并引入了任务专家混合 (MoTE) transformer 块,该模块利用通过任务感知对比学习 (\tacl) 训练的任务专用参数,以增强模型生成专用嵌入的能力。实证结果表明,MoTE 在检索数据集上实现了 64%64\% 的更高性能提升 (+3.27+5.21+3.27 \rightarrow +5.21),在所有数据集上实现了 43%43\% 的更高性能提升 (+1.81+2.60+1.81 \rightarrow +2.60)。关键在于,这些提升是在不改变指令、训练数据、推理时间或激活参数数量的情况下实现的。

关键词

引用

@article{arxiv.2506.17781,
  title  = {Beyond instruction-conditioning, MoTE: Mixture of Task Experts for Multi-task Embedding Models},
  author = {Miguel Romero and Shuoyang Ding and Corey D. Barret and Georgiana Dinu and George Karypis},
  journal= {arXiv preprint arXiv:2506.17781},
  year   = {2025}
}