中文

语音嵌入残差用于语调分类:消除语言内容以增强语音的语义分析

机器学习 2025-02-27 v1 计算与语言

摘要

自监督学习模型如 wav2vec2、HuBERT、WavLM 和 Whisper 生成的嵌入捕获了语言和语义信息的混合内容,这使得独立分析语调具有挑战性。本文引入一种方法,通过对语音嵌入对其对应文本嵌入进行回归并使用残差作为语音语调的表示。我们在多种自监督语音嵌入上进行评估,结果表明残差嵌入在语调分类任务中显著优于原始语音嵌入。我们的结果显示,这种方法提高了线性可分离性,使即使是简单的模型如逻辑回归也能实现改进的分类。残差嵌入的可视化进一步确认了成功消除语言信息的同时保留了与语调相关的特征。这些发现凸显了残差嵌入在情感分析、说话人特征刻画和语义语音处理等应用中的潜力。

关键词

引用

@article{arxiv.2502.19387,
  title  = {Residual Speech Embeddings for Tone Classification: Removing Linguistic Content to Enhance Paralinguistic Analysis},
  author = {Hamdan Al Ahbabi and Gautier Marti and Saeed AlMarri and Ibrahim Elfadel},
  journal= {arXiv preprint arXiv:2502.19387},
  year   = {2025}
}