中文

面向全息音频表示的 UniWhisper:高效的持续多任务训练框架

声音 2026-03-10 v2 人工智能

摘要

全息音频表示应在单个编码器中捕获细粒度语音线索及环境声和音乐的高层语义。现有编码器往往在某一领域表现突出,却在其他领域退化。我们提出UniWhisper,一种高效的持续多任务训练框架,将异构音频任务转化为统一的指令-答案格式。这使得标准的下一个标记训练无需任务特定的头部和损失函数。我们在3.8万小时公共音频数据上进行训练,并使用浅层 MLP 探针和k近邻(kNN)在20项任务(涵盖语音、环境声和音乐)上评估编码器。UniWhisper在MLP探针和kNN上的加权平均归一化得分分别达到0.81和0.61,显著优于Whisper的0.64和0.46,同时保持出色的语音性能。

关键词

引用

@article{arxiv.2602.21772,
  title  = {UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation},
  author = {Yuxuan Chen and Peize He and Haoyuan Yu and Junzi Zhang},
  journal= {arXiv preprint arXiv:2602.21772},
  year   = {2026}
}