中文

C-Pack:面向通用中文嵌入的打包资源

计算与语言 2024-09-25 v5 人工智能 信息检索

摘要

我们介绍 C-Pack,一套显著推进通用中文嵌入领域的资源包。C-Pack 包含三项关键资源。1) C-MTEB 是覆盖 6 项任务和 35 个数据集的中文文本嵌入综合基准。2) C-MTP 是从有标注与无标注中文语料库策划用于训练嵌入模型的大规模文本嵌入数据集。3) C-TEM 是覆盖多种尺寸的嵌入模型系列。我们的模型在发布时在 C-MTEB 上超越所有先前中文文本嵌入,提升幅度达 +10%。我们还整合并优化了 C-TEM 的整套训练方法。随我们的通用中文嵌入资源,我们发布了英文文本嵌入的数据与模型。英文模型在 MTEB 基准上取得最先进性能;同时,我们发布的英文数据规模为中文数据的 2 倍。所有资源已在 https://github.com/FlagOpen/FlagEmbedding 公开可用。

关键词

引用

@article{arxiv.2309.07597,
  title  = {C-Pack: Packed Resources For General Chinese Embeddings},
  author = {Shitao Xiao and Zheng Liu and Peitian Zhang and Niklas Muennighoff and Defu Lian and Jian-Yun Nie},
  journal= {arXiv preprint arXiv:2309.07597},
  year   = {2024}
}

备注

SIGIR 2024