自监督语音模型学习表示中的基于维数的异常检测
音频与语音处理
2026-05-05 v1 密码学与安全
机器学习
摘要
自监督语音模型(S3M)虽在下游任务中取得优异性能,但其学习到的表示在自然和对抗性扰动下的行为仍鲜有了解。现有研究依赖表示相似性或全局维数,难以洞察局部几何变化。我们提出 GRIDS 框架,利用局部固有维数(LID)分析 WavLM 和 wav2vec 2.0 各层表示。我们发现,所有低信噪比(SNR)扰动都会导致 LID 提升,而在高 SNR 下则发生分歧:良性噪声趋近于干净配置,對抗性输入则保留早期层的 LID 升高。我们进一步表明 LID 提升伴随 WER 增加,层级 LID 特征可实现异常检测(AUROC 0.78-1.00),为 S3M 提供了无转录物监控的可能。
引用
@article{arxiv.2605.02715,
title = {Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models},
author = {Sandra Arcos-Holzinger and Sarah M. Erfani and James Bailey and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2605.02715},
year = {2026}
}
备注
Submitted to Interspeech 2026