中文

VoxMorph:基于解耦嵌入的零样本语音身份形变

声音 2026-01-30 v1 密码学与安全 机器学习 音频与语音处理

摘要

形变技术生成由多个主体特征组合的人造生物识别样本,使每个贡献者均可通过单个注册模板进行验证。虽在人脸识别领域广泛研究,但此类漏洞在语音生物识别中仍鲁待探索。现有语音形变方法计算昂贵、不可扩展,且仅限于声学相似的身份对,限制了实际部署。此外,现有声音形变方法针对音频纹理、音乐或环境声音,难以用于语音身份操控。我们提出VoxMorph,一个零样本框架,可仅需每主体5秒音频即可生成高保真语音形变,无需模型再训练。该方法将声学特征解耦为韵律与时长嵌入,实现说话风格与身份的细粒度插值。这些嵌入通过球面线性插值(Slerp)融合,由自回归语言模型配合Conditional Flow Matching网络合成。VoxMorph实现了SOTA性能:音质提升2.6倍,语音识别错误率降低73%,在严格安全阈值下自动语音验证系统的形变攻击成功率达67.8%。本工作建立了语音形变的实用可扩展范式,对于生物识别安全具有深远影响。代码与数据集已在项目页面发布:https://vcbsl.github.io/VoxMorph/。

关键词

引用

@article{arxiv.2601.20883,
  title  = {VoxMorph: Scalable Zero-shot Voice Identity Morphing via Disentangled Embeddings},
  author = {Bharath Krishnamurthy and Ajita Rattani},
  journal= {arXiv preprint arXiv:2601.20883},
  year   = {2026}
}

备注

Accepted to IEEE ICASSP 2026 (51st International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2026). 5 pages, 1 figure, 3 tables. Project page: https://vcbsl.github.io/VoxMorph/