多模态基础模型是否足以应对 EmoFake 检测?
音频与语音处理
2025-09-22 v1
摘要
在本工作中,我们研究了用于 EmoFake 检测 (EFD) 的多模态基础模型 (MFMs),并假设它们将优于音频基础模型 (AFMs)。MFMs 由于其跨模态预训练,从多种模态中学习情感模式,而 AFMs 仅依赖音频。因此,MFMs 能更好地识别被操纵音频中不自然的情感转变和不一致性,使其在区分真实与虚假情感表达方面更有效。为验证我们的假设,我们对 SOTA 的 MFMs(如 LanguageBind)与 AFMs(如 WavLM)进行了全面的比较分析。我们的实验证实,在 EFD 任务上 MFMs 超越了 AFMs。除了单个基础模型 的性能外,受合成语音检测和语音情感识别等相关研究领域的发现启发,我们还探索了 FMs 融合。为此,我们提出了 SCAR,一种用于有效融合的新框架。SCAR 引入了一种嵌套交叉注意力机制,其中来自 FMs 的表征在两个阶段依次交互以精炼信息交换。此外,自注意力精炼模块通过强化重要的跨 FM 线索同时抑制噪声,进一步增强了特征表征。通过 SCAR 对 MFMs 的协同融合,我们实现了 SOTA 性能,超越了独立的 FMs、传统融合方法以及先前的 EFD 工作。
引用
@article{arxiv.2509.16193,
title = {Are Multimodal Foundation Models All That Is Needed for Emofake Detection?},
author = {Mohd Mujtaba Akhtar and Girish and Orchid Chetia Phukan and Swarup Ranjan Behera and Pailla Balakrishna Reddy and Ananda Chandra Nayak and Sanjib Kumar Nayak and Arun Balaji Buduru},
journal= {arXiv preprint arXiv:2509.16193},
year = {2025}
}
备注
Accepted to APSIPA-ASC 2025