基于协作多语言语音基础模型的面向情感伪造检测的原域与外域提升
音频与语音处理
2025-07-18 v1
摘要
本文聚焦情感伪造检测 (EmoFake Detection, EFD)。我们假设,由于其在多语言领域进行预训练,多语言语音基础模型 (multilingual speech foundation models, SFMs) 将在 EFD 中尤为有效,从而实现对音高、语调和强度等变化的细致理解。为验证这一假设,我们对最新 (SOTA) SFMs 进行了全面比较分析。我们的结果表明,多语言 SFMs 在同一语言 (原域) 以及跨语言 (外域) 评估中均表现优越。鉴于此,我们提出了一种受相关研究启发的融合方法——THAMA,用于融合基础模型 (foundation models, FMs)。THAMA 利用 Tucker 分解与哈德哈积的互补性,实现有效融合。与 THAMA 协同的多语言 SFMs 在原域和外域设置下均实现最佳性能,超越单个 FMs、基线融合技术以及先前的 SOTA 方法。
引用
@article{arxiv.2507.12595,
title = {Enhancing In-Domain and Out-Domain EmoFake Detection via Cooperative Multilingual Speech Foundation Models},
author = {Orchid Chetia Phukan and Mohd Mujtaba Akhtar and Girish and Arun Balaji Buduru},
journal= {arXiv preprint arXiv:2507.12595},
year = {2025}
}