一种用于学习语音表示的属性对齐策略
音频与语音处理
2021-09-09 v2 机器学习
摘要
语音技术的进步给我们的生活带来了便利。然而,由于语音信号包含多个个人属性,这可能导致敏感信息泄露或对决策产生偏见,人们的担忧正在上升。在本工作中,我们提出一种属性对齐学习策略,以推导可通过属性选择机制灵活解决这些问题的语音表示。具体而言,我们提出一种分层表示变分自编码器(LR-VAE),它将语音表示分解为属性敏感节点,以推导用于语音情感识别(SER)的无身份表示,以及用于说话人验证(SV)的无情感表示。我们提出的方法在無身份 SER 上取得了有竞争力的性能,并在无情感 SV 上取得了比当前最先进方法(在大型情感语料库 MSP-Podcast 上应用对抗学习)更好的性能。此外,我们提出的学习策略减少了实现多种隐私保护任务所需的模型和训练过程。
引用
@article{arxiv.2106.02810,
title = {An Attribute-Aligned Strategy for Learning Speech Representation},
author = {Yu-Lin Huang and Bo-Hao Su and Y. -W. Peter Hong and Chi-Chun Lee},
journal= {arXiv preprint arXiv:2106.02810},
year = {2021}
}
备注
5 pages, 2 figures; Accepted in Interspeech 2021