中文

语音后性别:面向跨女性视角的语音科学与技术

声音 2024-07-11 v1 机器学习 音频与语音处理

摘要

作为专业人士,跨女性性别矫正语音教师对语音拥有独特的视角,这些视角挑战了当前对说话人身份的理解。为此,我们展示了 Versatile Voice Dataset (VVD)——一个包含三位说话人沿性别轴线修改语音的数据集。VVD 说明,基于性别范畴和静态语音纹理理解的当前方法,无法考虑到语音管道的灵活性。我们利用公开的说话人嵌入,表明性别分类系统对语音修改高度敏感,而说话人验证系统在语音修改变得更剧烈时,无法识别出语音来自同一说话人。作为超越范畴化和静态说话人身份概念的一种路径,我们提出建模语音纹理中如音高、共振和重量等个体特征。

关键词

引用

@article{arxiv.2407.07235,
  title  = {Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology},
  author = {Robin Netzorg and Alyssa Cote and Sumi Koshin and Klo Vivienne Garoute and Gopala Krishna Anumanchipalli},
  journal= {arXiv preprint arXiv:2407.07235},
  year   = {2024}
}