中文

TrustSER:关于微调预训练语音嵌入用于语音情感识别的可信性研究

声音 2023-05-22 v1 音频与语音处理

摘要

近期研究探索了使用预训练嵌入进行语音情感识别(SER)的方法,取得了与依赖低层知识启发的声学特征的传统方法相当的性能。这些嵌入通常由在大规模语音数据集上采用自监督或弱监督学习目标训练的模型生成。尽管利用预训练嵌入在 SER 方面取得了显著进展,但人们对这些方法的可信性了解有限,包括隐私泄露、性能不公平、对抗攻击的脆弱性以及计算成本,这些都可能阻碍这些系统在实际场景中的部署。为此,我们提出了 TrustSER,一个通用框架,旨在使用深度学习方法评估 SER 系统的可信性,重点关注隐私、安全、公平性和可持续性,为该领域未来研究提供独特见解。我们的代码已公开:https://github.com/usc-sail/trust-ser。

关键词

引用

@article{arxiv.2305.11229,
  title  = {TrustSER: On the Trustworthiness of Fine-tuning Pre-trained Speech Embeddings For Speech Emotion Recognition},
  author = {Tiantian Feng and Rajat Hebbar and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2305.11229},
  year   = {2023}
}