基于听觉感知的人类模仿语音检测的光谱-时序调制表示框架
声音
2026-04-28 v1 计算与语言
摘要
人类模仿语音相对于 AI 生成语音在人类听者和自动检测系统方面都具有更大的挑战性。不同于 AI 生成语音常包含的伪影、过平滑的光谱或机器人线索,模仿语音是由人类自然产生的,因而保留了更高的自然度,这使得基于常规声学或声谱特征的模仿式语音伪造显得更难检测。为克服这一挑战,本研究提出了一种基于听觉感知的光谱-时序调制(STM)表示框架,用于人类模仿语音检测。STM 表示源自两个仿耳滤波器模型:Gammatone Filterbank (GTFB),它模拟了频率选择性,可视为仿耳滤波的第一近似;Gammachirp Filterbank (GCFB),进一步建模了频率选择性和电平相关的非对称性。这些 STM 表示共同捕捉语音信号在时域和频域的波动,分别对应于时频图中随时间变化的成分以及沿频轴方向的变化,反映人类听觉感知。我们还引入了 Segmental-STM 表示,用于分析跨重叠时间窗口的短期调制模式,实现对时序语音变异的高分辨率建模。实验结果表明,STM 表示对于人类模仿语音检测有效,准确率接近人类听者的水平。此外,Segmental-STM 表示更为有效,超越了人类的感知性能。这些发现表明,基于感知启发的光谱-时序建模对于检测模仿式语音攻击并提高语音认证的鲁棒性具有前景。
引用
@article{arxiv.2604.23241,
title = {Spectro-Temporal Modulation Representation Framework for Human-Imitated Speech Detection},
author = {Khalid Zaman and Masashi Unoki},
journal= {arXiv preprint arXiv:2604.23241},
year = {2026}
}