English
Related papers

Related papers: Kimi K2: Open Agentic Intelligence

200 papers

We introduce LongCat-Flash-Thinking-2601, a 560-billion-parameter open-source Mixture-of-Experts (MoE) reasoning model with superior agentic reasoning capability. LongCat-Flash-Thinking-2601 achieves state-of-the-art performance among…

Artificial Intelligence · Computer Science 2026-02-03 Meituan LongCat Team , Anchun Gui , Bei Li , Bingyang Tao , Bole Zhou , Borun Chen , Chao Zhang , Chao Zhang , Chen Gao , Chen Zhang , Chengcheng Han , Chenhui Yang , Chuyu Zhang , Cong Chen , Cunguang Wang , Daoru Pan , Defei Bu , Dengchang Zhao , Di Xiu , Dishan Liu , Dongyu Ru , Dunwei Tu , Fan Wu , Fengcheng Yuan , Fengcun Li , Gang Xu , Guanyu Wu , Guoyuan Lin , Haibin Wang , Hansi Yang , Hao Yang , Haonan Yan , Haoxiang Ma , Haoxing Wen , Hongyan Hao , Hongyin Tang , Hongyu Zang , Hongzhi Ni , Hui Su , Jiacheng Zhang , Jiahong Zhou , Jiahuan Li , Jiaming Wang , Jian Yang , Jianfei Zhang , Jianhao Xu , Jianing Wang , Jiapeng Zhu , Jiaqi Sun , Jiarong Shi , Jiarui Zhao , Jingang Wang , Jinluan Yang , Jinrui Ding , Jinwei Xiao , Jiyuan He , Juncan Xu , Kefeng Zhang , Keheng Wang , Li Wei , Lianhui Ma , Lin Qiu , Lingbing Kong , Lingchuan Liu , Linsen Guo , Mengshen Zhu , Mengxia Shen , Mingyang Zhu , Peiguang Li , Peng Pei , Peng Zhao , Pengcheng Jia , Pengtao Zhang , Ping Liu , Qi Gu , Qiong Huang , Qiyuan Duan , Quanchi Weng , Rongxiang Weng , Rongzhi Zhang , Rumei Li , Shanglin Lei , Shengnan An , Shijun Dai , Shizhe Wu , Shuaikang Liu , Shuang Zhou , Shuo Wang , Songyuan Zhao , Tao Liang , Tianhao Hu , Tianze Chen , Wei Liu , Wei Shi , Wei Wang , Weifeng Tang , Wenjie Shi , Wenlong Zhu , Wentao Chen , Wentao Shi , Xi Su , Xiandi Ma , Xiangcheng Liu , Xiangyu Xi , Xiangyuan Liu , Xiangzhou Huang , Xiao Liu , Xiaodong Cai , Xiaolong Chen , Xiaowei Shi , Xiaoyu Li , Xin Chen , Xingchen Liu , Xuan Huang , Xuezhi Cao , Xunliang Cai , Yan Chen , Yang Bai , Yang Liu , Yang Yang , Yang Zheng , Yanyu Chen , Yaoming Wang , Yaoming Zhu , Yaorui Shi , Yaqi Huo , Yerui Sun , Yi Zhang , Yi-Kai Zhang , Yifan Lu , Yifan Zhao , Yihao Chen , Yitao Zhai , Yongjing Yin , Yongwei Zhou , Youshao Xiao , Yu Wang , Yu Yang , Yuchen Xie , Yuchen Yu , Yuchuan Dai , Yue Xu , Yueqing Sun , Yufei Zhang , Yuhuai Wei , Yulei Qian , Yunfan Liang , Yunke Zhao , Yuwei Jiang , Yuxin Bian , Yuxin Chen , Yuxin Liu , Zeyang Yu , Zhao Yang , Zhengsheng Huang , Zhengyu Chen , Zhijian Liu , Zhikang Xia , Zhimin Lin , Zhiyuan Yao , Zhuofan Chen , Zhuowen Han , Zijian Zhang , Ziran Li , Ziwen Wang , Ziyuan Zhuang

Large Language Models (LLMs) are increasingly applied to software engineering (SWE), with SWE-bench as a key benchmark. Solutions are split into SWE-Agent frameworks with multi-turn interactions and workflow-based Agentless methods with…

We present Mu$^{2}$SLAM, a multilingual sequence-to-sequence model pre-trained jointly on unlabeled speech, unlabeled text and supervised data spanning Automatic Speech Recognition (ASR), Automatic Speech Translation (AST) and Machine…

Computation and Language · Computer Science 2023-06-28 Yong Cheng , Yu Zhang , Melvin Johnson , Wolfgang Macherey , Ankur Bapna

In the era of Large Language Models (LLMs), Mixture-of-Experts (MoE) architectures offer a promising approach to managing computational costs while scaling up model parameters. Conventional MoE-based LLMs typically employ static Top-K…

Computation and Language · Computer Science 2024-10-16 Tongtian Yue , Longteng Guo , Jie Cheng , Xuange Gao , Jing Liu

This report introduces the Qwen2 series, the latest addition to our large language models and large multimodal models. We release a comprehensive suite of foundational and instruction-tuned language models, encompassing a parameter range…

We introduce LongCat-Flash, a 560-billion-parameter Mixture-of-Experts (MoE) language model designed for both computational efficiency and advanced agentic capabilities. Stemming from the need for scalable efficiency, LongCat-Flash adopts…

Computation and Language · Computer Science 2025-09-22 Meituan LongCat Team , Bayan , Bei Li , Bingye Lei , Bo Wang , Bolin Rong , Chao Wang , Chao Zhang , Chen Gao , Chen Zhang , Cheng Sun , Chengcheng Han , Chenguang Xi , Chi Zhang , Chong Peng , Chuan Qin , Chuyu Zhang , Cong Chen , Congkui Wang , Dan Ma , Daoru Pan , Defei Bu , Dengchang Zhao , Deyang Kong , Dishan Liu , Feiye Huo , Fengcun Li , Fubao Zhang , Gan Dong , Gang Liu , Gang Xu , Ge Li , Guoqiang Tan , Guoyuan Lin , Haihang Jing , Haomin Fu , Haonan Yan , Haoxing Wen , Haozhe Zhao , Hong Liu , Hongmei Shi , Hongyan Hao , Hongyin Tang , Huantian Lv , Hui Su , Jiacheng Li , Jiahao Liu , Jiahuan Li , Jiajun Yang , Jiaming Wang , Jian Yang , Jianchao Tan , Jiaqi Sun , Jiaqi Zhang , Jiawei Fu , Jiawei Yang , Jiaxi Hu , Jiayu Qin , Jingang Wang , Jiyuan He , Jun Kuang , Junhui Mei , Kai Liang , Ke He , Kefeng Zhang , Keheng Wang , Keqing He , Liang Gao , Liang Shi , Lianhui Ma , Lin Qiu , Lingbin Kong , Lingtong Si , Linkun Lyu , Linsen Guo , Liqi Yang , Lizhi Yan , Mai Xia , Man Gao , Manyuan Zhang , Meng Zhou , Mengxia Shen , Mingxiang Tuo , Mingyang Zhu , Peiguang Li , Peng Pei , Peng Zhao , Pengcheng Jia , Pingwei Sun , Qi Gu , Qianyun Li , Qingyuan Li , Qiong Huang , Qiyuan Duan , Ran Meng , Rongxiang Weng , Ruichen Shao , Rumei Li , Shizhe Wu , Shuai Liang , Shuo Wang , Suogui Dang , Tao Fang , Tao Li , Tefeng Chen , Tianhao Bai , Tianhao Zhou , Tingwen Xie , Wei He , Wei Huang , Wei Liu , Wei Shi , Wei Wang , Wei Wu , Weikang Zhao , Wen Zan , Wenjie Shi , Xi Nan , Xi Su , Xiang Li , Xiang Mei , Xiangyang Ji , Xiangyu Xi , Xiangzhou Huang , Xianpeng Li , Xiao Fu , Xiao Liu , Xiao Wei , Xiaodong Cai , Xiaolong Chen , Xiaoqing Liu , Xiaotong Li , Xiaowei Shi , Xiaoyu Li , Xili Wang , Xin Chen , Xing Hu , Xingyu Miao , Xinyan He , Xuemiao Zhang , Xueyuan Hao , Xuezhi Cao , Xunliang Cai , Xurui Yang , Yan Feng , Yang Bai , Yang Chen , Yang Yang , Yaqi Huo , Yerui Sun , Yifan Lu , Yifan Zhang , Yipeng Zang , Yitao Zhai , Yiyang Li , Yongjing Yin , Yongkang Lv , Yongwei Zhou , Yu Yang , Yuchen Xie , Yueqing Sun , Yuewen Zheng , Yuhuai Wei , Yulei Qian , Yunfan Liang , Yunfang Tai , Yunke Zhao , Zeyang Yu , Zhao Zhang , Zhaohua Yang , Zhenchao Zhang , Zhikang Xia , Zhiye Zou , Zhizhao Zeng , Zhongda Su , Zhuofan Chen , Zijian Zhang , Ziwen Wang , Zixu Jiang , Zizhe Zhao , Zongyu Wang , Zunhai Su

Mixture-of-Experts large language models (MoE-LLMs) marks a significant step forward of language models, however, they encounter two critical challenges in practice: 1) expert parameters lead to considerable memory consumption and loading…

Machine Learning · Computer Science 2025-02-25 Wei Huang , Yue Liao , Jianhui Liu , Ruifei He , Haoru Tan , Shiming Zhang , Hongsheng Li , Si Liu , Xiaojuan Qi

We present a comprehensive theoretical and empirical study of the Muon optimizer for training transformers only with a small to medium decoder (30M - 200M parameters), with an emphasis on its mathematical foundations, convergence properties…

Machine Learning · Computer Science 2025-09-30 Sushant Mehta , Raj Dandekar , Rajat Dandekar , Sreedath Panat

The Mixture-of-Experts (MoE) architecture has become a predominant paradigm for scaling large language models (LLMs). Despite offering strong performance and computational efficiency, large MoE-based LLMs like DeepSeek-V3-0324 and…

Machine Learning · Computer Science 2025-08-08 Xiaodong Chen , Mingming Ha , Zhenzhong Lan , Jing Zhang , Jianguo Li

Recent large language models such as Gemini-1.5, DeepSeek-V3, and Llama-4 increasingly adopt Mixture-of-Experts (MoE) architectures, which offer strong efficiency-performance trade-offs by activating only a fraction of the model per token.…

Computation and Language · Computer Science 2025-05-27 Hao Kang , Zichun Yu , Chenyan Xiong

Fine-tuning large language models (LLMs) with high-quality knowledge has been shown to enhance their performance effectively. However, there is a paucity of research on the depth of domain-specific knowledge comprehension by LLMs and the…

Computation and Language · Computer Science 2026-03-19 Haoxuan Yin , Bojian Liu , Chen Tang , Yangfan Wang , Lian Yan , Jingchi Jiang

We introduce Kimi Linear, a hybrid linear attention architecture that, for the first time, outperforms full attention under fair comparisons across various scenarios -- including short-context, long-context, and reinforcement learning (RL)…

The evolving LLM landscape requires capabilities beyond simple text generation, prioritizing multi-step reasoning, long-context understanding, and agentic workflows. This shift challenges existing models in enterprise environments,…

Computation and Language · Computer Science 2026-03-25 KT Tech innovation Group

We introduce Motif-2-12.7B, a new open-weight foundation model that pushes the efficiency frontier of large language models by combining architectural innovation with system-level optimization. Designed for scalable language understanding…

In this paper, we introduce Hunyuan-Large, which is currently the largest open-source Transformer-based mixture of experts model, with a total of 389 billion parameters and 52 billion activation parameters, capable of handling up to 256K…

We present MiMo-7B, a large language model born for reasoning tasks, with optimization across both pre-training and post-training stages. During pre-training, we enhance the data preprocessing pipeline and employ a three-stage data mixing…

There is currently no unified metric for evaluating the efficiency of quantized neural networks. We propose QuIDE, built around the Intelligence Index I = (C x P)/log_2(T+1), which collapses the compression-accuracy-latency trade-off into a…

Machine Learning · Computer Science 2026-05-13 Xiantao Jiang

We demonstrate that Muon, the simplest instantiation of a second-order optimizer, explicitly expands the Pareto frontier over AdamW on the compute-time tradeoff. We find that Muon is more effective than AdamW in retaining data efficiency at…

AI agents are increasingly used to solve real-world tasks by reasoning over multi-turn user interactions and invoking external tools. However, applying reinforcement learning to such settings remains difficult: realistic objectives often…