Nomic Embed:训练可复现的长上下文文本嵌入模型
计算与语言
2025-02-05 v2 人工智能
摘要
本技术报告描述了 nomic-embed-text-v1 的训练过程,这是首个完全可复现、开源、开放权重、开放数据的 8192 上下文长度英语文本嵌入模型,其在短上下文 MTEB 基准测试和长上下文 LoCo 基准测试上的表现均优于 OpenAI Ada-002 和 OpenAI text-embedding-3-small。我们在 Apache 2.0 许可下发布了训练代码和模型权重。与其他开源模型不同,我们发布了完整的精选训练数据和代码,使得 nomic-embed-text-v1 可以被完全复现。您可以在 https://github.com/nomic-ai/contrastors 找到复现该模型所需的代码和数据。
引用
@article{arxiv.2402.01613,
title = {Nomic Embed: Training a Reproducible Long Context Text Embedder},
author = {Zach Nussbaum and John X. Morris and Brandon Duderstadt and Andriy Mulyar},
journal= {arXiv preprint arXiv:2402.01613},
year = {2025}
}
备注
Accepted to TMLR https://openreview.net/forum?id=IPmzyQSiQE