中文

处理音频-视觉表情识别中模态缺失的训练策略

音频与语音处理 2020-12-02 v2 声音 图像与视频处理

摘要

自动音频-视觉表情识别可在远程医疗、VOIP通话与人机交互等通信服务中发挥重要作用。音频-视觉表情识别的准确率可受益于两种模态之间的相互作用。然而,大多数在理想条件下训练的音频-视觉表情识别系统,在真实场景中都无法泛化,因为由于带宽受限、交互者朝向、呼叫方主动静音等多种原因,音频或视觉模态可能会缺失。本文研究了当其中一种模态缺失时,最先进的 transformer 的性能。我们进行消融研究以评估任一模态缺失情况下的模型表现。此外,我们提出一种在训练期间于片段或帧级别随机消融视觉输入的策略,以模拟真实场景。在真实环境数据上进行的结果表明,所提出的在缺失线索上训练的模型具有显著的泛化能力,帧级消融带来的增益高达17%,显示这些训练策略能更好地应对输入模态的丢失。

关键词

引用

@article{arxiv.2010.00734,
  title  = {Training Strategies to Handle Missing Modalities for Audio-Visual Expression Recognition},
  author = {Srinivas Parthasarathy and Shiva Sundaram},
  journal= {arXiv preprint arXiv:2010.00734},
  year   = {2020}
}

备注

ICMI 2020 workshop on "MODELING SOCIO-EMOTIONAL AND COGNITIVE PROCESSES FROM MULTIMODAL DATA IN THE WILD"