中文

LFM2技术报告

机器学习 2025-12-01 v1 人工智能

摘要

我们提出LFM2,一套面向高效设备部署和强大任务能力的液态基础模型家族。通过在边缘延迟和内存约束下的硬件-在环架构搜索,我们获得了一种紧凑混合主干网络,组合受控短卷积和少量分组查询注意力块,相较于同等规模模型在CPU上实现前填充和解码速度提升最高达2倍。LFM2家族覆盖350M至8.3B参数,包括稠密模型(350M、700M、1.2B、2.6B)及混合专家变体(8.3B总参数,1.5B活跃参数),均支持32K上下文长度。LFM2的训练管线包括温和、解耦的Top-K知识蒸馏目标(避免支持不匹配)、难度排序数据中的课程学习,以及三阶段后训练流程:监督微调、长度归一化偏好优化和模型合并。在10-12万亿标记上预训练后,LFM2模型在多样化基准测试中取得优异成绩;例如,LFM2-2.6B在IFEval上达到79.56%,在GSM8K上达到82.41%。我们进一步构建了多模态和检索变体:LFM2-VL用于视觉语言任务,LFM2-Audio用于语音,LFM2-ColBERT用于检索。LFM2-VL支持通过基于token的高效视觉处理实现可调的准确率-延迟权衡,而LFM2-Audio分离音频输入与输出路径,实现与3倍更大模型相当的实时语音到语音交互。LFM2-ColBERT提供面向查询和文档的低延迟编码器,实现多语言高性能检索。所有模型均随开放权重及ExecuTorch、llama.cpp和vLLM的部署软件包发布,使LFM2成为需要快速、内存高效推理和强大任务能力的边缘应用的实用基础。

关键词

引用

@article{arxiv.2511.23404,
  title  = {LFM2 Technical Report},
  author = {Alexander Amini and Anna Banaszak and Harold Benoit and Arthur Böök and Tarek Dakhran and Song Duong and Alfred Eng and Fernando Fernandes and Marc Härkönen and Anne Harrington and Ramin Hasani and Saniya Karwa and Yuri Khrustalev and Maxime Labonne and Mathias Lechner and Valentine Lechner and Simon Lee and Zetian Li and Noel Loo and Jacob Marks and Edoardo Mosca and Samuel J. Paech and Paul Pak and Rom N. Parnichkun and Alex Quach and Ryan Rogers and Daniela Rus and Nayan Saxena and Bettina Schlager and Tim Seyde and Jimmy T. H. Smith and Aditya Tadimeti and Neehal Tumma},
  journal= {arXiv preprint arXiv:2511.23404},
  year   = {2025}
}