中文

语音维度独立性量化:基于信息论的解耦表示学习框架

声音 2026-02-25 v1 音频与语音处理

摘要

语音信号在共享声学信道中编码了情感、语言和病理信息;然而,解耦通常通过下游任务性能间接评估。我们引入信息论框架,通过整合有界神经互信息(MI)估计与非参数验证,来量化手工声学特征之间的跨维度统计依赖性。在六个语料库中,跨维度MI保持较低,估计边界紧密(<0.15< 0.15 nats),表明所考虑数据中的统计耦合较弱,而Source--Filter MI 显著更高(0.47 nats)。归因分析,即总MI归属于source 还是 filter 成分的比例,揭示了情感维度中source 主导(80%),而语言和病理维度中filter 主导(分别为60% 和58%)。这些发现为量化语音的维度独立性提供了原则框架。

关键词

引用

@article{arxiv.2602.20592,
  title  = {Quantifying Dimensional Independence in Speech: An Information-Theoretic Framework for Disentangled Representation Learning},
  author = {Bipasha Kashyap and Björn W. Schuller and Pubudu N. Pathirana},
  journal= {arXiv preprint arXiv:2602.20592},
  year   = {2026}
}