OCON 模型:面向智能城市语音监测的分布式监督分类
声音
2025-07-01 v1 人工智能
音频与语音处理
摘要
本文探讨了 One-Class 方法和 One-Class-One-Network 模型在监督分类任务中的结构化应用,聚焦于元音音素分类和说话人识别,属于自动语音识别(ASR)领域。针对具体案例,ASR 模型运行于专有感知与闪电系统上,用于监控城市街道的声学和空气污染。我们对 One-Class 方法与 One-Network 模型的组合进行形式化建模,开展伪神经网络架构搜索与超参数调优实验,使用以经验为导向的网格搜索方法,实现了与当代最复杂架构相当的分类准确率,深入考察了说话人识别和能源效率方面的问题。尽管该模型方案简单,但其在语言和说话人性别上下文中的广泛适用性具有很好的前景,经相关统计与性能指标验证。我们的实验代码已公开于 GitHub。
引用
@article{arxiv.2410.04098,
title = {The OCON model: an old but green solution for distributable supervised classification for acoustic monitoring in smart cities},
author = {Stefano Giacomelli and Marco Giordano and Claudia Rinaldi},
journal= {arXiv preprint arXiv:2410.04098},
year = {2025}
}
备注
Accepted at "IEEE 5th International Symposium on the Internet of Sounds, 30 Sep / 2 Oct 2024, Erlangen, Germany"