中文

面向跨语言语音情感识别的说话人风格感知音素锚定

计算与语言 2025-09-26 v1 机器学习

摘要

跨语言语音情感识别(SER)因不同语言中音素可变性和说话人特定表达风格的差异,仍是一个具有挑战性的任务。有效捕捉情感表达在如此多样的条件下所需的框架,需要能够在不同说话人和语言之间对情感外部化进行对齐。为此,我们提出了一种说话人风格感知音素锚定框架,通过图基聚类捕获共享说话人特征,在说话人和音素空间中应用双空间锚定,以实现跨语言的情感传递。评估在MSP-Podcast(英文)和BIIC-Podcast(台湾闽南语)语料库上显示,与竞争性基线方法相比,模型在跨语言情感表示的常见性方面表现出 improved generalization,并提供了关于跨语言情感表示共通性的宝贵见解。

关键词

引用

@article{arxiv.2509.20373,
  title  = {Speaker Style-Aware Phoneme Anchoring for Improved Cross-Lingual Speech Emotion Recognition},
  author = {Shreya G. Upadhyay and Carlos Busso and Chi-Chun Lee},
  journal= {arXiv preprint arXiv:2509.20373},
  year   = {2025}
}