说话人嵌入用于暴力检测的合理有效性
音频与语音处理
2024-06-12 v1 声音
摘要
在本文中,我们专注于音频暴力检测(AVD)。AVD在多种场景下是必要的,尤其是在维护安全、防止伤害和确保安全方面。这要求有准确的AVD系统。与音频处理中的许多相关应用一样,提升性能最常用的方法是利用自监督(SSL)预训练模型(PTM)。然而,这些SSL模型是非常大的模型,拥有数百万个参数,这可能阻碍其在实际环境中的部署,尤其是在计算受限的环境中。为解决此问题,我们提出使用说话人识别模型,其规模远小于SSL模型。通过使用说话人识别模型嵌入并结合SVM和随机森林作为分类器进行实验,我们表明,与最先进的(SOTA)SSL模型相比,说话人识别模型嵌入表现最佳,并达到了SOTA结果。
引用
@article{arxiv.2406.06798,
title = {The Reasonable Effectiveness of Speaker Embeddings for Violence Detection},
author = {Sarthak Jain and Orchid Chetia Phukan and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2406.06798},
year = {2024}
}
备注
Accepted to INTERSPEECH 24 Show & Tell Demonstrations