来自代码生成模型的高效代码嵌入
计算与语言
2025-09-01 v1 人工智能
信息检索
摘要
jina-code-embeddings 是一个新颖的代码嵌入模型套件,旨在从自然语言查询中检索代码、执行技术问答、并跨编程语言识别语义相似的代码片段。它创新性地利用了面向自回归主干的预训练模型,该模型在文本和代码上进行预训练,通过最后一个标记池化生成嵌入。我们概述了训练配方,展示了尽管模型规模相对较小,仍实现了最新的性能,验证了这种代码嵌入模型构建方法。
引用
@article{arxiv.2508.21290,
title = {Efficient Code Embeddings from Code Generation Models},
author = {Daria Kryvosheieva and Saba Sturua and Michael Günther and Scott Martens and Han Xiao},
journal= {arXiv preprint arXiv:2508.21290},
year = {2025}
}
备注
9 pages, table and evaluations 5-9