中文

SONAR-LLM: 基于句子嵌入的自回归 Transformer 模型

计算与语言 2026-05-27 v2

摘要

最近提出的大概念模型(Large Concept Model, LCM)通过预测句子级别的嵌入序列来生成文本,并采用均方误差或扩散目标进行训练。我们提出SONAR-LLM,一种仅解码器的 Transformer 模型,其“思考”于相同的连续SONAR嵌入空间中,但通过冻结SONAR解码器传递的标记级交叉熵进行监督。这种混合目标保留了LCM的语义抽象优势,同时消除了其扩散采样器,恢复了基于似然的训练信号。在3900万至13亿参数的模型规模范围内,SONAR-LLM实现了具竞争力的生成质量。我们报告了规模化趋势、消融实验、基准测试结果,并发布了完整的训练代码和所有预训练检查点,以促进可重复性和后续研究。

关键词

引用

@article{arxiv.2508.05305,
  title  = {SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens},
  author = {Nikita Dragunov and Temurbek Rahmatullaev and Elizaveta Goncharova and Nikita Kurdiukov and Aysel Mirzoeva and Anna Borisiuk and Andrey Kuznetsov and Anton Razzhigaev},
  journal= {arXiv preprint arXiv:2508.05305},
  year   = {2026}
}