解构神经语音表示的文本与声学特征
计算与语言
2024-10-07 v1 机器学习
声音
音频与语音处理
摘要
神经语音模型构建高度 entangled 的内部表示,捕获各种特征(如基频、响度、句法类别或词语语义内容),以分布式编码形式呈现。这种复杂性使得难以追踪这些表示依赖文本和声学信息的程度,或抑制可能在关键实际应用中构成隐私风险的声学特征编码(如性别或说话人身份)。本文基于信息瓶颈原理,提出一种解构框架,将复杂语音表示分离为两个 distinct 组件:一个编码内容(即可转写为文本的信息),另一个编码与给定下游任务相关的声学特征。我们将该框架应用于情感识别和说话人识别下游任务,对每个模型层量化文本和声学特征的贡献。此外,我们探讨将解构框架用作归因方法,以从文本和声学两个角度识别最突出的语音帧表示。
引用
@article{arxiv.2410.03037,
title = {Disentangling Textual and Acoustic Features of Neural Speech Representations},
author = {Hosein Mohebbi and Grzegorz Chrupała and Willem Zuidema and Afra Alishahi and Ivan Titov},
journal= {arXiv preprint arXiv:2410.03037},
year = {2024}
}