基于口部发音运动的锚定方法用于改进跨语料库语音情感识别
声音
2024-12-31 v1 机器学习
音频与语音处理
摘要
跨语料库语音情感识别(SER)在诸多实际应用中发挥着重要作用。传统的跨语料库情感迁移方法通常专注于调整声学特征以适配不同语料库、领域或标签。然而,由于说话者差异、领域迁移以及录音环境的影响,声学特征本质上具有变动性且容易出错。为应对这些挑战,本研究采用一种新颖的对比方法,聚焦于情感特定的语音发声手势作为分析的核心元素。通过将注意力转向更稳定且一致的语音发声手势,我们旨在增强SER任务中的情感迁移学习。我们的研究以CREMA-D和MSP-IMPROV语料库作为基准测试,揭示了这些语音发声手势的常见性和可靠性。研究结果表明,口部发声手势的潜力更适合作为提升不同设置或领域下情感识别的约束条件。
引用
@article{arxiv.2412.19909,
title = {Mouth Articulation-Based Anchoring for Improved Cross-Corpus Speech Emotion Recognition},
author = {Shreya G. Upadhyay and Ali N. Salman and Carlos Busso and Chi-Chun Lee},
journal= {arXiv preprint arXiv:2412.19909},
year = {2024}
}