Mercury:基于扩散模型的超高速语言模型
计算与语言
2025-06-24 v1 人工智能
机器学习
摘要
我们提出 Mercury,这是一代商业规模的大型语言模型 (LLM),基于扩散模型构建。这些模型通过 Transformer 架构实现参数化,并训练以并行预测多个标记。在本报告中,我们详细阐述了 Mercury Coder——我们首批针对编码应用设计的扩散 LLM。目前 Mercury Coder 提供 Mini 与 Small 两个规模。这些模型在速度-质量前沿上树立了新的最佳纪录。根据 Artificial Analysis 进行的独立评估,Mercury Coder Mini 和 Mercury Coder Small 在 NVIDIA H100 GPU 上分别实现了 1109 个标记/秒和 737 个标记/秒的领先吞吐量,平均性能优于速度优化的前沿模型最高可达 10 倍,同时保持可比的质量。我们还在多个编程语言和用例的各种代码基准上提供额外结果,并通过 Copilot Arena 中的开发者实际验证,显示该模型在质量排名第二且整体最快。我们同时在 https://platform.inceptionlabs.ai/ 推出公共 API,并在 https://chat.inceptionlabs.ai 提供免费沙盘。
引用
@article{arxiv.2506.17298,
title = {Mercury: Ultra-Fast Language Models Based on Diffusion},
author = {Inception Labs and Samar Khanna and Siddhant Kharbanda and Shufan Li and Harshit Varma and Eric Wang and Sawyer Birnbaum and Ziyang Luo and Yanis Miraoui and Akash Palrecha and Stefano Ermon and Aditya Grover and Volodymyr Kuleshov},
journal= {arXiv preprint arXiv:2506.17298},
year = {2025}
}
备注
15 pages; equal core, cross-function, senior authors listed alphabetically