OSUM-Pangu: 基于Ascend NPU的开源多维语音理解基础模型
声音
2026-03-12 v1
摘要
近期语音大语言模型的快速发展显著提升了多维语音理解能力。然而,大多数高性能框架都主要针对 GPU 生态系统和专有底层架构进行优化,导致在非 CUDA 计算基础设施上的部署存在显著差距。本文提出 OSUM-Pangu,一个完全开源的语音理解基础模型,构建于完全非 CUDA 的软件和硬件堆栈之上。通过将音频编码器与 openPangu-7B LLM 底层模型集成,成功在 Ascend NPU 平台上实现了整个训练和推理流程。为适应非 CUDA 资源约束下的高效任务对齐,我们采用一种实用的训练过程,依次桥接语音感知与用户意图识别。实验结果表明,OSUM-Pangu 在任务准确率上与主流 GPU 模型相当,同时保持了稳健的自然语言交互能力。我们的工作为开源语音社区提供了一个可复现的非 CUDA 基准,推动了多模态智能的独立演进。
关键词
引用
@article{arxiv.2603.10862,
title = {OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs},
author = {Yujie Liao and Xuelong Geng and Hongfei Xue and Shuiyuan Wang and Lei Xie},
journal= {arXiv preprint arXiv:2603.10862},
year = {2026}
}
备注
5 pages, 2 figures