中文

WavInWav: 基于可逆神经网络的时域语音隐藏

声音 2025-10-06 v1 人工智能 密码学与安全 机器学习 音频与语音处理

摘要

数据隐藏是数字媒体安全通信的关键技术,近年来深度神经网络(DNN)的发展为有效嵌入秘密信息提供了增强手段。然而,先前的音频隐藏方法在恢复秘密音频时往往质量不理想,这是由于它们在建模时频关系方面存在固有局限。本文探讨了这些局限并提出了一种新的 DNN 方法。我们采用基于流的(flow-based)可逆神经网络,在隐写音频、载体音频与秘密音频之间建立直接联系,增强嵌入与提取消息的可逆性。为解决时频变换在恢复过程中降低秘密音频质量的常见问题,我们在时域信号上实施时频损失。该方法不仅保留了时频约束的优势,还提升了消息恢复的可逆性,这对实际应用至关重要。我们还加入加密技术以保护隐藏数据免受未授权访问。在 VCTK 和 LibriSpeech 数据集上的实验结果表明,我们的方法在主观和客观指标上均优于先前方法,并对多种噪声表现出鲁棒性,表明其在定向安全通信场景中的实用性。

关键词

引用

@article{arxiv.2510.02915,
  title  = {WavInWav: Time-domain Speech Hiding via Invertible Neural Network},
  author = {Wei Fan and Kejiang Chen and Xiangkun Wang and Weiming Zhang and Nenghai Yu},
  journal= {arXiv preprint arXiv:2510.02915},
  year   = {2025}
}

备注

13 pages, 5 figures, project page: https://cyberrrange.github.io/project/wavinwav