VoiceSHIELD-Small:实时恶意语音检测与转录
介观与纳米尺度物理
2026-03-10 v1
摘要
语音界面正迅速成为人们与 AI 系统交互的常用方式,这也带来了新的安全风险,如提示注入、社交工程和有害语音命令。传统安全方法依赖将语音转为文本后进行过滤,引入延迟且可能忽略重要的音频线索。本文引入 VoiceSHIELD-Small,一个轻量级实时模型,能够一步完成语音转录和是否为恶意的检测。基于 OpenAI Whisper-small 编码器,VoiceSHIELD 添加了一个均值池化层和一个简单的分类头。在中端 GPU 上,仅需 90-120 毫秒即可完成分类,同时实现转录。在一组平衡的 947 个音频片段上测试,模型实现了 99.16% 的准确率和 0.9865 的 F1 分数。默认设置下,漏检恶意输入为 2.33%。交叉验证显示性能稳定(F1 标准差为 0.0026)。本文还涵盖模型设计、训练数据、性能权衡以及负责任的使用指南。VoiceSHIELD 在 MIT 许可下发布,以鼓励进一步的研究和在语音 AI 安全领域的采用。
引用
@article{arxiv.2603.07706,
title = {DeepConf: Machine Learning Conformer Reconstruction of Biomolecules from Scanning Tunneling Microscopy Images},
author = {Tim J. Seifert and Dhaneesh Kumar and Markus Etzkorn and Stephan Rauschenbach and Klaus Kern and Kelvin Anggara and Uta Schlickum},
journal= {arXiv preprint arXiv:2603.07706},
year = {2026}
}