语音后性别:面向跨女性视角的语音科学与技术
声音
2024-07-11 v1 机器学习
音频与语音处理
摘要
作为专业人士,跨女性性别矫正语音教师对语音拥有独特的视角,这些视角挑战了当前对说话人身份的理解。为此,我们展示了 Versatile Voice Dataset (VVD)——一个包含三位说话人沿性别轴线修改语音的数据集。VVD 说明,基于性别范畴和静态语音纹理理解的当前方法,无法考虑到语音管道的灵活性。我们利用公开的说话人嵌入,表明性别分类系统对语音修改高度敏感,而说话人验证系统在语音修改变得更剧烈时,无法识别出语音来自同一说话人。作为超越范畴化和静态说话人身份概念的一种路径,我们提出建模语音纹理中如音高、共振和重量等个体特征。
引用
@article{arxiv.2407.07235,
title = {Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology},
author = {Robin Netzorg and Alyssa Cote and Sumi Koshin and Klo Vivienne Garoute and Gopala Krishna Anumanchipalli},
journal= {arXiv preprint arXiv:2407.07235},
year = {2024}
}