中文

VoiceSHIELD-Small:实时恶意语音检测与转录

介观与纳米尺度物理 2026-03-10 v1

摘要

语音界面正迅速成为人们与 AI 系统交互的常用方式,这也带来了新的安全风险,如提示注入、社交工程和有害语音命令。传统安全方法依赖将语音转为文本后进行过滤,引入延迟且可能忽略重要的音频线索。本文引入 VoiceSHIELD-Small,一个轻量级实时模型,能够一步完成语音转录和是否为恶意的检测。基于 OpenAI Whisper-small 编码器,VoiceSHIELD 添加了一个均值池化层和一个简单的分类头。在中端 GPU 上,仅需 90-120 毫秒即可完成分类,同时实现转录。在一组平衡的 947 个音频片段上测试,模型实现了 99.16% 的准确率和 0.9865 的 F1 分数。默认设置下,漏检恶意输入为 2.33%。交叉验证显示性能稳定(F1 标准差为 0.0026)。本文还涵盖模型设计、训练数据、性能权衡以及负责任的使用指南。VoiceSHIELD 在 MIT 许可下发布,以鼓励进一步的研究和在语音 AI 安全领域的采用。

关键词

引用

@article{arxiv.2603.07706,
  title  = {DeepConf: Machine Learning Conformer Reconstruction of Biomolecules from Scanning Tunneling Microscopy Images},
  author = {Tim J. Seifert and Dhaneesh Kumar and Markus Etzkorn and Stephan Rauschenbach and Klaus Kern and Kelvin Anggara and Uta Schlickum},
  journal= {arXiv preprint arXiv:2603.07706},
  year   = {2026}
}