中文

基于音视频适配器的灵活模态欺骗检测

计算机视觉与模式识别 2023-02-14 v1

摘要

通过人类行为检测欺骗在许多领域至关重要,如海关安全与多媒体反欺诈。近来,音视频欺骗检测因优于仅用单一模态而受到更多关注。然而,在真实世界多模态设定中,数据完整性可能成问题(例如,有时仅有部分模态可用)。缺失模态可能导致性能下降,但模型仍学习缺失模态的特征。本文中,为进一步提升性能并克服缺失模态问题,我们提出了一种基于Transformer的新颖框架,带有音视频适配器(AVA),以高效融合两模态间的时序特征。在两个基准数据集上的大量实验表明,所提方法在灵活模态(多模态与缺失模态)设定下相较于其他多模态融合方法能取得更优性能。

关键词

引用

@article{arxiv.2302.05727,
  title  = {Flexible-modal Deception Detection with Audio-Visual Adapter},
  author = {Zhaoxu Li and Zitong Yu and Nithish Muthuchamy Selvaraj and Xiaobao Guo and Bingquan Shen and Adams Wai-Kin Kong and Alex Kot},
  journal= {arXiv preprint arXiv:2302.05727},
  year   = {2023}
}