中文

VoxAnchor:基于毫米波雷达将语音真实性锚定于喉部振动

人机交互 2026-03-31 v1

摘要

语音合成和音频编辑技术的快速进步使得逼真的伪造材料日益易于获取,但现有的检测方法要么易受篡改,要么依赖视觉或可穿戴传感器。本文提出了 VoxAnchor,一种通过利用语音声学与雷达感知喉部振动之间的内在一致性,将音频认证物理锚定于声带动态的系统。VoxAnchor 使用接触式毫米波雷达捕获与人类语音产生紧密耦合的细粒度喉部振动,构建一个根植于人体生理学的难以伪造的锚点。系统设计包括三个主要组成部分:(1)一种使用特定模态编码器和对比学习以检测词级细微不匹配的跨模态框架;(2)一种能提取物理上一致、时序忠实喉部振动的相位感知流程;(3)一种结合信号级 onset 检测和语义级一致性以对齐非同步雷达与音频流的双阶段策略。与仅确认语音发生的活体检测不同,VoxAnchor 通过词级内容一致性验证具体说了什么内容,暴露那些保留身份和全局真实性线索的局部编辑。广泛的评估表明,VoxAnchor 在多样化的伪造(编辑、拼接、回放、深度伪造)和条件下实现了稳健、细粒度的检测,总体 EER 为 0.017,延迟低,计算成本适中。

关键词

引用

@article{arxiv.2603.27562,
  title  = {VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar},
  author = {Mingda Han and Huanqi Yang and Chaoqun Li and Wenhao Li and Guoming Zhang and Yanni Yang and Yetong Cao and Weitao Xu and Pengfei Hu},
  journal= {arXiv preprint arXiv:2603.27562},
  year   = {2026}
}