面向音视频人物识别与验证的模态融合方法比较分析
音频与语音处理
2024-11-05 v2 计算机视觉与模式识别
多媒体
声音
摘要
多模态学习涉及整合来自各种模态的信息以增强学习和理解。在本文中,我们通过处理声音和面部两个模态来比较人物识别和验证中的三种模态融合策略。本文采用一维卷积神经网络从声音中提取 x-vector,同时利用预训练的 VGGFace2 网络和迁移学习用于面部模态。此外,我们使用 gammatonegram 作为语音表示与 Darknet19 预训练网络结合。对提出的系统在 VoxCeleb2 数据集测试集的 118 位说话者上采用 K 折交叉验证技术进行评估。比较评估是在平等情况下进行的,针对单模态和三个提出的多模态策略。结果表明,gammatonegram 与面部特征融合的特征融合策略在人物识别任务中实现了最高的性能,准确率达到 98.37%。然而,将面部特征与 x-vector 拼接可在验证任务中实现 0.62% 的 EER。
引用
@article{arxiv.2409.00562,
title = {Comparative Analysis of Modality Fusion Approaches for Audio-Visual Person Identification and Verification},
author = {Aref Farhadipour and Masoumeh Chapariniya and Teodora Vukovic and Volker Dellwo},
journal= {arXiv preprint arXiv:2409.00562},
year = {2024}
}
备注
This paper was accepted at the ICNLSP2024 conference