中文

自监督语音模型学习表示中的基于维数的异常检测

音频与语音处理 2026-05-05 v1 密码学与安全 机器学习

摘要

自监督语音模型(S3M)虽在下游任务中取得优异性能,但其学习到的表示在自然和对抗性扰动下的行为仍鲜有了解。现有研究依赖表示相似性或全局维数,难以洞察局部几何变化。我们提出 GRIDS 框架,利用局部固有维数(LID)分析 WavLM 和 wav2vec 2.0 各层表示。我们发现,所有低信噪比(SNR)扰动都会导致 LID 提升,而在高 SNR 下则发生分歧:良性噪声趋近于干净配置,對抗性输入则保留早期层的 LID 升高。我们进一步表明 LID 提升伴随 WER 增加,层级 LID 特征可实现异常检测(AUROC 0.78-1.00),为 S3M 提供了无转录物监控的可能。

关键词

引用

@article{arxiv.2605.02715,
  title  = {Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models},
  author = {Sandra Arcos-Holzinger and Sarah M. Erfani and James Bailey and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2605.02715},
  year   = {2026}
}

备注

Submitted to Interspeech 2026