基于语音基础模型的多视图多任务建模用于语音 forensic 任务
音频与语音处理
2024-10-18 v1 声音
摘要
语音 forensic 任务(SFTs),如自动说话人识别(ASR)、语音情感识别(SER)、性别识别(GR)和年龄估计(AE),在不同的安全和生物识别应用中具有重要价值。以往的研究应用了各种技术,最近的研究聚焦于应用语音基础模型(SFM)以提高性能。然而,大多数先前的工作都集中在为每个任务单独构建模型,尽管这些任务之间存在内在相似性。这种孤立的方法导致更高的计算资源需求、增加的成本、时间消耗以及维护难题。本研究通过采用多任务学习策略来解决这些挑战。首先,我们探索了各种最先进(SOTA)SFM,通过提取它们的表示来学习这些 SFTs 并具体分析其在每个任务上的有效性。其次,我们在多任务学习框架中分析提取表示在 SFTs 上的性能。我们观察到,当 SFTs 被建模为整体时,其性能会低于单个任务特定模型为 remedy,本文提出了多视图学习(MVL)。视图是来自不同 SFM 的表示,通过每个 SFM 独特特征转化为不同的抽象空间。通过利用 MVL,我们整合这些多样化的表示以捕捉跨任务的互补信息,从而增强共享学习过程。我们引入了一个名为 TANGO(Task Alignment with iNter-view Gated Optimal transport)的新框架来实现该方法。通过 TANGO,我们在诸如 CREMA-D、emo-DB 和 BAVED 等基准数据集上实现了最顶级的性能,与单个 SFM 表示以及基线融合技术相比较。
引用
@article{arxiv.2410.12947,
title = {Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks},
author = {Orchid Chetia Phukan and Devyani Koshal and Swarup Ranjan Behera and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2410.12947},
year = {2024}
}