中文

voc2vec:面向非语言语音的基础模型

音频与语音处理 2025-02-25 v1 声音

摘要

语音基础模型在语音相关任务中展现出卓越的能力。然而,这些模型常常难以处理非语音音频数据,如非语言语音、婴儿啼哭等,这些数据在各种实际应用中至关重要。音频基础模型虽能处理非语音数据,但也无法捕捉非语言人类声音的细微特征。本文旨在克服上述不足,提出一种新颖的基础模型,称为voc2vec,专为非语言人类数据设计,仅利用开源非语言音频数据集。我们收集了10个数据集,涵盖约125小时的非语言音频。实验结果表明,voc2vec在非语言语音分类任务中效果良好,优于常规的语音和音频基础模型。此外,voc2vec在六个不同基准数据集上 consistently 优于强大的基线模型,即OpenSmile和emotion2vec。据我们所知,voc2vec是首个面向语音任务的通用表示模型。

关键词

引用

@article{arxiv.2502.16298,
  title  = {voc2vec: A Foundation Model for Non-Verbal Vocalization},
  author = {Alkis Koudounas and Moreno La Quatra and Marco Sabato Siniscalchi and Elena Baralis},
  journal= {arXiv preprint arXiv:2502.16298},
  year   = {2025}
}

备注

Accepted at ICASSP 2025