C2LLM技术报告:基于自适应跨注意力池化的代码检索新范例
计算与语言
2025-12-25 v1 人工智能
摘要
我们提出C2LLM——对比代码大型语言模型,一个包含0.5B和7B两种规模的代码嵌入模型族。基于Qwen-2.5-Coder背bone,C2LLM采用多头注意力池化(PMA)模块用于从标记嵌入生成序列嵌入,有效实现了三点:1) 利用预训练期间获得的LLM因果表示;2) 能够聚合序列中所有标记的信息,打破基于EOS的序列嵌入中的信息瓶颈;3) 支持灵活的嵌入维度调整,作为MRL的替代方案。在三百万个公开数据上进行训练,C2LLM模型在MTEB-Code中树立了类似规模模型的新纪录,其中C2LLM-7B在整体排行榜上名列第1。
引用
@article{arxiv.2512.21332,
title = {C2LLM Technical Report: A New Frontier in Code Retrieval via Adaptive Cross-Attention Pooling},
author = {Jin Qin and Zihan Liao and Ziyin Zhang and Hang Yu and Peng Di and Rui Wang},
journal= {arXiv preprint arXiv:2512.21332},
year = {2025}
}