使用变长软池化从语音表示中移除说话人信息
声音
2024-04-02 v1 人工智能
音频与语音处理
摘要
最近,已有研究致力于使用自监督框架为语音合成编码语音的语言信息。然而,从周围表示中预测表示可能会无意中将说话人信息纠缠在语音表示中。本文旨在利用语音的结构化特性来移除说话人信息,该特性由具有清晰边界的音素等离散单元组成。神经网络预测这些边界,从而实现基于事件的表示提取的变长池化,而非固定速率方法。边界预测器输出介于 0 和 1 之间的边界概率,使池化变软。模型经过训练以最小化与经过时间拉伸和音高移位数据增强后的池化表示之间的差异。为了确认学习到的表示包含内容信息但独立于说话人信息,使用 libri-light 的音素 ABX 任务和 SUPERB 的说话人识别任务对该模型进行了评估。
引用
@article{arxiv.2404.00856,
title = {Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling},
author = {Injune Hwang and Kyogu Lee},
journal= {arXiv preprint arXiv:2404.00856},
year = {2024}
}