中文

对比学习与混合专家实现精确的向量嵌入

机器学习 2024-12-19 v3 人工智能 计算与语言

摘要

Transformer 神经网络的发展显著提升了句子相似性模型的能力,但它们在处理高判别性任务时仍存在困难,并且可能对科学文献等重要文档产生次优表示。随着对检索增强和搜索的依赖日益增加,将多样化文档表示为简洁且具描述性的向量至关重要。本文通过使用共被引作为相似性度量来整合细分数据集,聚焦于生物医学领域,从而改进了科学文本的向量嵌入。我们将一种新颖的混合专家扩展流水线应用于预训练 BERT 模型,其中每个多层感知机部分都被扩大并复制为多个独立的专家。我们的 MoE 变体在包含 NN 个科学领域和 NN 个专用专家的情况下表现良好,而标准 BERT 模型一次只能在一个领域上表现出色。值得注意的是,仅将单个 Transformer 块扩展为 MoE 即可捕获在每一层进行完整 MoE 扩展所带来收益的 85%。这为以数值方式表示多样化输入的通用且高效的“一刀切”Transformer 网络带来了希望。我们的方法标志着表示学习的进步,并有望增强向量数据库的搜索与编译。

关键词

引用

@article{arxiv.2401.15713,
  title  = {Contrastive Learning and Mixture of Experts Enables Precise Vector Embeddings},
  author = {Logan Hallee and Rohan Kapur and Arjun Patel and Jason P. Gleghorn and Bohdan Khomtchouk},
  journal= {arXiv preprint arXiv:2401.15713},
  year   = {2024}
}