中文

用于主动说话人检测的端到端音视频特征融合

声音 2022-11-24 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

主动说话人检测在人机交互中起着至关重要的作用。最近出现了一些端到端音视频框架。然而,这些模型的推理时间未被探究,并且由于其复杂性和较大的输入尺寸,不适用于实时应用。此外,它们探索了类似的在音频和视觉输入上使用 ConvNet 的特征提取策略。本工作提出了一种新颖的双流端到端框架,将通过 VGG-M 从图像提取的特征与从音频波形提取的原始梅尔频率倒谱系数特征相融合。网络在每个流上连接两个 BiGRU 层以处理各流的时间动态,融合后连接一个 BiGRU 层以建模联合时间动态。在 AVA-ActiveSpeaker 数据集上的实验结果表明,我们的新特征提取策略比在两种模态上使用 ConvNet 的模型对噪声信号更具鲁棒性且推理时间更优。所提模型在 44.41 ms 内完成预测,足以满足实时应用。我们性能最佳的模型达到了 88.929% 的准确率,与最先进工作几乎相同的检测结果。

关键词

引用

@article{arxiv.2207.13434,
  title  = {End-To-End Audiovisual Feature Fusion for Active Speaker Detection},
  author = {Fiseha B. Tesema and Zheyuan Lin and Shiqiang Zhu and Wei Song and Jason Gu and Hong Wu},
  journal= {arXiv preprint arXiv:2207.13434},
  year   = {2022}
}

备注

To appear on the proceeding of the Fourteenth International Conference on Digital Image Processing (ICDIP 2022), May 20-23, Wuhan, China, 8 pages, 3 figures