探究多语言语音基础模型用于从人群中学习集体情绪
音频与语音处理
2025-09-23 v1 声音
摘要
本文探究了用于群体情绪识别(CER)的多语言语音基础模型(SFM)。我们假设,在多种语言、口音和语音模式上预训练的多语言 SFM,特别擅长处理群体环境中特有的嘈杂和复杂声学环境,从而为 CER 提供了显著优势。为了证实这一点,我们进行了全面分析,通过在基准 CER 数据集上针对不同音频时长(1 秒、500 毫秒和 250 毫秒)进行广泛实验,比较了多语言、单语言和说话人识别 SFM。结果一致证明了多语言 SFM 的优越性,其在所有音频长度上均优于其他模型,即使在极短时长输入下也表现出色。这些发现为调整 SFM 以建立 CER 新基准铺平了道路。
引用
@article{arxiv.2509.16329,
title = {Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds},
author = {Orchid Chetia Phukan and Girish and Mohd Mujtaba Akhtar and Panchal Nayak and Priyabrata Mallick and Swarup Ranjan Behera and Parabattina Bhagath and Pailla Balakrishna Reddy and Arun Balaji Buduru},
journal= {arXiv preprint arXiv:2509.16329},
year = {2025}
}
备注
Accepted to APSIPA-ASC 2025