中文

阐明歌唱声音转录中的性别公平性

声音 2023-08-08 v1 机器学习 音频与语音处理

摘要

众所周知,男性和女性在歌唱时通常具有不同的声音特征,如音色和音高,但从未有人探究这些基于性别的特征是否会导致歌唱声音转录(SVT,其目标包含音高)中的性能差异。这种差异可能引发公平性问题,并严重影响下游SVT应用的用户体验。受此驱动,我们首先展示了SVT系统的女性优势,该现象在不同模型和数据集上均被观察到。我们发现,不同的音高分布而非性别数据不平衡导致了这一差异。为解决此问题,我们提出使用属性预测器预测性别标签,并对SVT系统进行对抗训练以强制声学表示的性别不变性。利用音高分布可能导致性别偏见的先验知识,我们提出通过将音符事件输入属性预测器,在人口群体间条件对齐声学表示。在多个基准SVT数据集上的实证实验表明,我们的方法在域内和域外歌唱数据上均以可忽略的整体SVT性能下降显著降低了性别偏见(降幅超过50%),从而提供了更好的公平性-效用权衡。

关键词

引用

@article{arxiv.2308.02898,
  title  = {Elucidate Gender Fairness in Singing Voice Transcription},
  author = {Xiangming Gu and Wei Zeng and Ye Wang},
  journal= {arXiv preprint arXiv:2308.02898},
  year   = {2023}
}

备注

Camera-ready version of ACM MM2023