中文

基于音视频热多模态数据的人物验证研究

计算机视觉与模式识别 2022-03-07 v2 声音 音频与语音处理 图像与视频处理

摘要

本文研究一种利用音频、视觉和热模态进行多模态人物验证的方法。音频与视觉模态的结合已被证明对鲁棒人物验证有效。基于此,我们探究通过加入热图像进一步增加模态数量的影响。特别地,我们使用最先进的深度学习架构实现了单模态、双模态和三模态验证系统,并在干净与含噪条件下比较其性能。我们还比较了基于简单分数平均与软注意力机制的两种流行融合方法。在SpeakingFaces数据集上的实验展示了三模态验证系统的优越性能。具体而言,在简单测试集上,在干净与含噪两种条件下,三模态系统分别比最佳单模态和双模态系统的相对等错误率低逾50%和18%。在困难测试集上,在干净与含噪两种条件下,三模态系统分别比最佳单模态和双模态系统的相对等错误率低逾40%和13%。为便于实验复现并推动多模态人物验证研究,我们已在GitHub仓库中免费提供代码、预训练模型及预处理数据集。

关键词

引用

@article{arxiv.2110.12136,
  title  = {A Study of Multimodal Person Verification Using Audio-Visual-Thermal Data},
  author = {Madina Abdrakhmanova and Saniya Abushakimova and Yerbolat Khassanov and Huseyin Atakan Varol},
  journal= {arXiv preprint arXiv:2110.12136},
  year   = {2022}
}

备注

7 pages, 4 figures, 4 tables