低资源印度语言中音频滥用检测的少样本对比适应
声音
2026-04-13 v1 计算与语言
摘要
随着社交媒体转向基于语音的交互,特别是在多语言和低资源环境中,滥用语音检测变得越来越重要。当前大多数系统依赖于自动语音识别(ASR)后接基于文本的仇恨言论分类,但这种流水线容易受到转录错误的影响,并且丢弃了语音中携带的韵律信息。我们研究了对比语言-音频预训练(CLAP)是否可以直接从音频支持滥用语音检测。使用ADIMA数据集,我们在跨语言和留一语言设置下,在少样本监督对比适应中评估了基于CLAP的表示,并将零样本提示作为辅助分析。我们的结果表明,CLAP在十种印度语言中产生了强大的跨语言音频表示,并且轻量级的仅投影适应在性能上可与在完整训练数据上训练的完全监督系统相媲美。然而,少样本适应的好处依赖于语言,并且不随样本数量单调变化。这些发现表明,对比音频-文本模型为低资源环境下的跨语言音频滥用检测提供了一个有前景的基础,同时也表明迁移仍然不完整,并且在重要方面具有语言特异性。
引用
@article{arxiv.2604.09094,
title = {Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages},
author = {Aditya Narayan Sankaran and Reza Farahbakhsh and Noel Crespi},
journal= {arXiv preprint arXiv:2604.09094},
year = {2026}
}
备注
14 pages, preprint under review