中文

C2LLM技术报告:基于自适应跨注意力池化的代码检索新范例

计算与语言 2025-12-25 v1 人工智能

摘要

我们提出C2LLM——对比代码大型语言模型,一个包含0.5B和7B两种规模的代码嵌入模型族。基于Qwen-2.5-Coder背bone,C2LLM采用多头注意力池化(PMA)模块用于从标记嵌入生成序列嵌入,有效实现了三点:1) 利用预训练期间获得的LLM因果表示;2) 能够聚合序列中所有标记的信息,打破基于EOS的序列嵌入中的信息瓶颈;3) 支持灵活的嵌入维度调整,作为MRL的替代方案。在三百万个公开数据上进行训练,C2LLM模型在MTEB-Code中树立了类似规模模型的新纪录,其中C2LLM-7B在整体排行榜上名列第1。

关键词

引用

@article{arxiv.2512.21332,
  title  = {C2LLM Technical Report: A New Frontier in Code Retrieval via Adaptive Cross-Attention Pooling},
  author = {Jin Qin and Zihan Liao and Ziyin Zhang and Hang Yu and Peng Di and Rui Wang},
  journal= {arXiv preprint arXiv:2512.21332},
  year   = {2025}
}