中文

MFSN:面向语音情感识别中预训练知识的多视角融合搜索网络

音频与语音处理 2024-06-27 v3 计算与语言 声音

摘要

语音情感识别(SER)是人机交互中的重要研究课题。许多近期工作聚焦于通过预训练知识直接提取情感线索,常忽视恰当性与全面性的考量。因此,我们提出了一种用于 SER 中预训练知识的新框架,称为多视角融合搜索网络(MFSN)。在全面性方面,我们将语音知识划分为文本相关情感内容(TEC)与语音相关情感内容(SEC),从语义与声学双视角捕获线索,并设计新的架构搜索空间以充分利用它们。在恰当性方面,我们验证了不同建模方法在捕获 SEC 上的有效性,并填补了当前研究的空白。多个数据集上的实验结果证明了 MFSN 的优越性。

关键词

引用

@article{arxiv.2306.09361,
  title  = {MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition},
  author = {Haiyang Sun and Fulin Zhang and Yingying Gao and Zheng Lian and Shilei Zhang and Junlan Feng},
  journal= {arXiv preprint arXiv:2306.09361},
  year   = {2024}
}