阐明歌唱声音转录中的性别公平性
声音
2023-08-08 v1 机器学习
音频与语音处理
摘要
众所周知,男性和女性在歌唱时通常具有不同的声音特征,如音色和音高,但从未有人探究这些基于性别的特征是否会导致歌唱声音转录(SVT,其目标包含音高)中的性能差异。这种差异可能引发公平性问题,并严重影响下游SVT应用的用户体验。受此驱动,我们首先展示了SVT系统的女性优势,该现象在不同模型和数据集上均被观察到。我们发现,不同的音高分布而非性别数据不平衡导致了这一差异。为解决此问题,我们提出使用属性预测器预测性别标签,并对SVT系统进行对抗训练以强制声学表示的性别不变性。利用音高分布可能导致性别偏见的先验知识,我们提出通过将音符事件输入属性预测器,在人口群体间条件对齐声学表示。在多个基准SVT数据集上的实证实验表明,我们的方法在域内和域外歌唱数据上均以可忽略的整体SVT性能下降显著降低了性别偏见(降幅超过50%),从而提供了更好的公平性-效用权衡。
引用
@article{arxiv.2308.02898,
title = {Elucidate Gender Fairness in Singing Voice Transcription},
author = {Xiangming Gu and Wei Zeng and Ye Wang},
journal= {arXiv preprint arXiv:2308.02898},
year = {2023}
}
备注
Camera-ready version of ACM MM2023