基于时域的伪造音频表示嵌入方法
音频与语音处理
2022-10-28 v1 声音
摘要
反欺骗是语音认证的任务,即辨别真实人类语音与伪造语音。本文的主要目标是基于音频波形幅值的概率质量函数(PMF)估计,为真实与伪造语音提出新的表示。我们引入了一种针对语音音频信号的特征提取新方法:与传统方法不同,我们的方法直接对时域音频样本进行处理。通过设计基于不同 PMF 距离与相似性度量的特征提取器来利用 PMF。作为附加步骤,我们采用了滤波器组预处理,其显著影响了特征的判别特性,并便于对伪造攻击的可能聚类进行可视化。此外,我们使用扩散映射来揭示数据所位于的底层流形。所提出的嵌入允许使用简单线性分离器以获得良好性能。另外,我们提出了一种便捷的数据可视化方式,有助于评估不同欺骗技术的效率。实验结果表明,在多通道基于 PMF 的特征用于反欺骗任务之外,使用扩散映射作为分析工具与嵌入工具均具有潜力。
引用
@article{arxiv.2210.15428,
title = {Time-Domain Based Embeddings for Spoofed Audio Representation},
author = {Matan Karo and Arie Yeredor and Itshak Lapidot},
journal= {arXiv preprint arXiv:2210.15428},
year = {2022}
}