您的 Mixture-of-Experts LLM 其实就是免费的嵌入模型
计算与语言
2024-10-17 v2 机器学习
摘要
虽然大型语言模型(LLM)在生成任务中表现出色,但其解码器架构常常限制其作为嵌入模型的潜力,若不进行进一步的表示微调。 这是否与其声称的通用性相矛盾? 为回答此问题,我们仔细研究了 Mixture-of-Experts(MoE)LLM。我们的研究表明,MoE LLM 中的专家路由器(expert routers)可作为即插即用型嵌入模型,在多样化的以嵌入为中心的任务上展现出前景的性能,且无需任何微调。此外,我们的广泛分析表明,MoE 路由权重(Routing Weights, RW)与 LLM 的隐藏状态(Hidden State, HS)是互补的,后者是广泛使用的嵌入表示。与 HS 相比,我们发现 RW 对提示词选择更稳健,能够聚焦于高层语义。基于此分析,我们提出了 MoEE,将 RW 与 HS 结合起来,实现优于单独使用的更佳性能。我们对其组合方式和提示策略的探索揭示了若干新颖见解,例如,RW 与 HS 相似性的加权求和优于它们拼接后的相似性。我们的实验在 6 个嵌入任务、20 个数据集(来自 Massive Text Embedding Benchmark, MTEB)上进行,结果表明 MoEE 为基于 LLM 的嵌入带来了显著提升,无需进一步微调。
引用
@article{arxiv.2410.10814,
title = {Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free},
author = {Ziyue Li and Tianyi Zhou},
journal= {arXiv preprint arXiv:2410.10814},
year = {2024}
}
备注
Code: https://github.com/tianyi-lab/MoE-Embedding