面向公平语音情感识别的置信度导向语音增强去偏方法——CO-VADA
音频与语音处理
2025-11-17 v2 计算与语言
摘要
语音情感识别(SER)系统中的偏见常源于说话人特征与情感标签之间的虚假相关性,导致跨人口统计群体的预测不公平。许多现有去偏方法需要模型特定的修改或依赖人口统计信息,限制了其实际应用。我们提出 CO-VADA(Confidence-Oriented Voice Augmentation Debiasing),一种置信度导向语音增强去偏方法,通过识别训练数据中反映偏见模式的样本并应用语音转换以改变不相关属性并生成新样本来缓解偏见。这些增强样本引入的说话人差异与数据中占主导地位的模式不同,引导模型更关注情感相关特征。该框架与各种 SER 模型和语音转换工具兼容,具有可扩展且实用的提升 SER 系统公平性的优势。
引用
@article{arxiv.2506.06071,
title = {CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition},
author = {Yun-Shao Tsai and Yi-Cheng Lin and Huang-Cheng Chou and Hung-yi Lee},
journal= {arXiv preprint arXiv:2506.06071},
year = {2025}
}
备注
Accepted by IEEE ASRU 2025