中文

AUD-TGN:在自然视听环境中利用时序卷积与 GPT-2 推进面部动作单元检测

计算机视觉与模式识别 2024-03-21 v1

摘要

利用音频数据和视觉数据的协同作用对于理解人类情绪和行为至关重要,尤其是在自然环境中。整合此类多模态信息的传统方法常常受阻,导致在面部动作单元检测任务中的效果不尽如人意。为了克服这些缺点,我们提出了一种利用视听多模态数据的新方法。该方法利用 Mel 频率倒谱系数(MFCC)和 Log-Mel 频谱图特征以及预训练的 VGGish 网络来增强音频特征提取。此外,本文通过对时序关系进行建模,跨模态自适应地捕获融合特征,并利用预训练的 GPT-2 模型对多模态信息进行复杂的上下文感知融合。我们的方法通过理解数据的时序和上下文细微差别,显著提高了 AU 检测的准确性,展示了对复杂场景理解的重大进展。这些发现突显了整合时序动态和上下文解释的潜力,为未来的研究工作铺平了道路。

关键词

引用

@article{arxiv.2403.13678,
  title  = {AUD-TGN: Advancing Action Unit Detection with Temporal Convolution and GPT-2 in Wild Audiovisual Contexts},
  author = {Jun Yu and Zerui Zhang and Zhihong Wei and Gongpeng Zhao and Zhongpeng Cai and Yongqi Wang and Guochen Xie and Jichao Zhu and Wangyuan Zhu},
  journal= {arXiv preprint arXiv:2403.13678},
  year   = {2024}
}