Kimi-Audio 技术报告
音频与语音处理
2025-04-28 v1 人工智能
计算与语言
机器学习
多媒体
声音
摘要
我们介绍 Kimi-Audio,这是一个在音频理解、生成和对话方面表现卓越的开源音频基础模型。我们详细阐述了构建 Kimi-Audio 的实践,包括模型架构、数据 curated、训练配方、推理部署和评估。具体而言,我们采用 12.5Hz 的音频 tokenizer,设计一种基于大语言模型的新型架构,输入为连续特征、输出为离散标记,并开发一种基于流匹配的块状流式解标记器。我们构建了一个由超过 1300 万小时音频数据构成的 pre-training 数据集,涵盖包括语音、声音和音乐在内的广泛模态,并构建了一个用于构建高质量且多样化 post-training 数据的管道。初始化自 pre-trained LLM,Kimi-Audio 在音频和文本数据上进行持续 pre-training,采用若干精心设计的任务,然后微调以支持多样化的音频相关任务。广泛的评估显示,Kimi-Audio 在包括语音识别、音频理解、音频问答和语音对话等多个音频基准测试中实现了最先进的性能。我们在 https://github.com/MoonshotAI/Kimi-Audio 上发布了代码、模型 checkpoint 以及评估工具包。
引用
@article{arxiv.2504.18425,
title = {Kimi-Audio Technical Report},
author = {KimiTeam and Ding Ding and Zeqian Ju and Yichong Leng and Songxiang Liu and Tong Liu and Zeyu Shang and Kai Shen and Wei Song and Xu Tan and Heyi Tang and Zhengtao Wang and Chu Wei and Yifei Xin and Xinran Xu and Jianwei Yu and Yutao Zhang and Xinyu Zhou and Y. Charles and Jun Chen and Yanru Chen and Yulun Du and Weiran He and Zhenxing Hu and Guokun Lai and Qingcheng Li and Yangyang Liu and Weidong Sun and Jianzhou Wang and Yuzhi Wang and Yuefeng Wu and Yuxin Wu and Dongchao Yang and Hao Yang and Ying Yang and Zhilin Yang and Aoxiong Yin and Ruibin Yuan and Yutong Zhang and Zaida Zhou},
journal= {arXiv preprint arXiv:2504.18425},
year = {2025}
}