中文

基于视频的人物识别的帧聚合与多模态融合框架

计算机视觉与模式识别 2021-01-01 v2 多媒体

摘要

基于视频的人物识别由于人物被遮挡和模糊以及拍摄角度的变化而具有挑战性。以往的研究总是关注静态图像上的人物识别,忽略了视频帧之间的相似性与连续性。为应对上述挑战,我们提出一种新颖的用于基于视频的人物识别的帧聚合与多模态融合(FAMF)框架,该框架聚合人脸特征并将其与多模态信息结合以识别视频中的人物。对于帧聚合,我们提出一种基于 NetVLAD 的可训练新层(称为 AttentionVLAD),其以任意数量的特征作为输入并基于特征质量计算固定长度的聚合特征。我们表明,在 NetVLAD 中引入注意力机制可有效降低低质量帧的影响。对于视频的多模型信息,我们提出多层多模态注意力(MLMA)模块,通过自适应更新 Gram 矩阵来学习多模态的相关性。在 iQIYI-VID-2019 数据集上的实验结果表明,我们的框架优于其他最先进的方法。

关键词

引用

@article{arxiv.2010.09290,
  title  = {Frame Aggregation and Multi-Modal Fusion Framework for Video-Based Person Recognition},
  author = {Fangtao Li and Wenzhe Wang and Zihe Liu and Haoran Wang and Chenghao Yan and Bin Wu},
  journal= {arXiv preprint arXiv:2010.09290},
  year   = {2021}
}

备注

Accepted by MMM 2021