中文

语音情感的声学与语义建模

音频与语音处理 2026-03-11 v1

摘要

情感在人类沟通中占据核心位置,塑造着信任、参与度和社交互动。随着由大型语言模型驱动的人工智能系统日益融入日常生活,使其能够可靠地理解和生成人类情感仍是重要挑战。虽然情感表达本质上是多模态的,但本论文聚焦于通过语言传递的情感,探讨声学与语义信息如何联合建模以推动情感理解和情感合成。论文的前半部分研究通过预训练实现情感感知表示学习。我们提出了策略,将声学和语义监督纳入学习能够更好捕捉情感线索的表示。还引入了一种语音驱动的监督预训练框架,使大规模情感感知文本建模无需手动标注文本语料库。后半部分针对对话场景中的情感识别,开发了层次化架构,结合跨模态注意力和混合专家融合,在对话轮次之间整合声学与语义信息。最后,本论文提出一种无文本且非平行的语音到语音框架,用于情感风格迁移,实现可控的情感转换,同时保持说话人身份和语言内容。结果表明,情感迁移效果得到改善,风格迁移后的语音可用于数据增强以提高情感识别性能。

关键词

引用

@article{arxiv.2603.09212,
  title  = {Acoustic and Semantic Modeling of Emotion in Spoken Language},
  author = {Soumya Dutta},
  journal= {arXiv preprint arXiv:2603.09212},
  year   = {2026}
}

备注

PhD thesis