Jina Embeddings:一组新型高性能句子嵌入模型
计算与语言
2023-10-23 v3 人工智能
信息检索
机器学习
摘要
Jina Embeddings 是一组高性能句子嵌入模型,擅长将文本输入转化为数值表示,捕捉文本的语义。这些模型在稠密检索与语义文本相似度等应用中表现出色。本文详述了 Jina Embeddings 的开发过程,始于高质量成对与三元组数据集的构建。它强调了数据清洗在数据集准备中的关键作用,深入剖析模型训练过程,并以使用 Massive Text Embedding Benchmark (MTEB) 的全面性能评估作结。此外,为增强模型对语法否定的感知,我们构建了一个否定与非否定语句的新型训练与评估数据集,并公开供社区使用。
引用
@article{arxiv.2307.11224,
title = {Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models},
author = {Michael Günther and Louis Milliken and Jonathan Geuter and Georgios Mastrapas and Bo Wang and Han Xiao},
journal= {arXiv preprint arXiv:2307.11224},
year = {2023}
}
备注
9 pages, 2 page appendix