基于少样本学习的低资源环境下跨语言音频滥用检测
计算与语言
2024-12-16 v3 人工智能
摘要
在低资源环境下,尤其是在音频模态中,线上滥用内容检测仍属探索薄弱的领域。我们研究了针对印度语言使用少样本学习(FSL)检测滥用语言的预训练音频表示潜力。利用来自Wav2Vec和Whisper等模型的强大表示,我们在ADIMA数据集上使用FSL探索跨语言滥用检测。我们的 метод将这些表示集成到模型无关元学习(MAML)框架中,用于分类10种语言中的滥用语言。我们实验不同的shot大小(50-200),评估有限数据对性能的影响。此外,还进行了特征可视化研究,以更好地理解模型行为。该研究突出了预训练模型在低资源场景下的泛化能力,并为在多语言环境中检测滥用语言提供了有价值的见解。
引用
@article{arxiv.2412.01408,
title = {Towards Cross-Lingual Audio Abuse Detection in Low-Resource Settings with Few-Shot Learning},
author = {Aditya Narayan Sankaran and Reza Farahbakhsh and Noel Crespi},
journal= {arXiv preprint arXiv:2412.01408},
year = {2024}
}
备注
Accepted as part of the proceedings of COLING 2025