OSUM:面向学术界有限资源的开放语音理解模型
声音
2025-02-18 v2 计算与语言
音频与语音处理
摘要
大型语言模型(LLM)在各类下游任务中取得了显著进展,激发了开发语音理解语言模型(SULM)以实现综合性语音交互的热潮。然而,大多数先进的 SULM 都是由产业界开发的,利用大规模数据集和计算资源,而这些资源在学术界难以获得。此外,训练细节的缺乏透明度创造了额外的创新障碍。本研究提出了 OSUM(Open Speech Understanding Model),一个旨在探索在受限学术资源下训练 SULM 可能性的开放语音理解模型。OSUM 模型将 Whisper 编码器与 Qwen2 LLM 结合起来,支持广泛的语音任务,包括语音识别(ASR)、带时间戳的语音识别(SRWT)、人声事件检测(VED)、语音情感识别(SER)、说话风格识别(SSR)、说话人性别分类(SGC)、说话人年龄预测(SAP)和语音转文本聊天(STTC)。通过采用 ASR+X 训练策略,OSUM 实现了高效稳定的多任务训练,通过同时优化 ASR 以及目标任务。除了提供卓越的性能外,OSUM 强调透明度,公开可用的数据准备和训练方法,为学术界提供了宝贵的见解和实用指导。通过此举,我们旨在加速先进 SULM 技术的研究与创新。
引用
@article{arxiv.2501.13306,
title = {OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia},
author = {Xuelong Geng and Kun Wei and Qijie Shao and Shuiyun Liu and Zhennan Lin and Zhixian Zhao and Guojian Li and Wenjie Tian and Peikun Chen and Yangze Li and Pengcheng Guo and Mingchen Shao and Shuiyuan Wang and Yuang Cao and Chengyou Wang and Tianyi Xu and Yuhang Dai and Xinfa Zhu and Yue Li and Li Zhang and Lei Xie},
journal= {arXiv preprint arXiv:2501.13306},
year = {2025}
}
备注
OSUM Technical Report v2. The experimental results reported herein differ from those in v1 because of adding new data and training in more steps