中文

EchoMark:基于嵌入房间脉冲响应的感知声学环境迁移

声音 2026-04-01 v2 人工智能 机器学习 音频与语音处理

摘要

声学环境匹配 (AEM) 是将干净音频转换为目标声学环境的任务,使其能够应用于音频配音和听觉沉浸式虚拟现实 (VR)。从回声语中直接恢复相似的房间脉冲响应 (RIR) 提供了更易访问且更灵活的 AEM 解决方案。然而,这一能力也引入了若被恶意用户滥用时可能导致的“任意迁移”漏洞,例如促进高级语音欺骗攻击或破坏录音证据的真实性。为解决此问题,我们提出 EchoMark,首个基于深度学习的 AEM 框架,生成感知上相似的 RIR 并嵌入水印。我们的设计通过在潜在域中处理变动的 RIR 特征(如不同时长和能量衰减),来应对这些挑战。我们还通过联合优化模型,采用用于 RIR 重建的感知损失和用于水印检测的损失,EchoMark 实现了高质量的环境迁移和可靠的水印恢复。在多样化数据集上的实验表明,EchoMark 的房间声学参数匹配性能与最先进的 RIR 估计器 FiNS 相当。此外,水印检测准确率超过 99%,平均意见分 (MOS) 达 4.22(满分 5 分),误码率 (BER) 低于 0.3%,共同展示了 EchoMark 在保持感知质量的同时确保可靠水印嵌入的有效性。

关键词

引用

@article{arxiv.2511.06458,
  title  = {EchoMark: Perceptual Acoustic Environment Transfer with Watermark-Embedded Room Impulse Response},
  author = {Chenpei Huang and Lingfeng Yao and Kyu In Lee and Lan Emily Zhang and Xun Chen and Miao Pan},
  journal= {arXiv preprint arXiv:2511.06458},
  year   = {2026}
}