PESFormer:通过直接时间戳编码提升宏观与微观表情检测
计算机视觉与模式识别
2024-10-25 v1
摘要
宏观与微观表情检测旨在精确定位和分类未裁剪视频中的时序表情实例。鉴于表情稀疏分布和时长变化,现有基于锚点的 метод往往通过编码相对于预定义锚点的偏移来表示实例。此外,这些方法通常将未裁剪视频切分为固定长度的滑动窗口。然而,基于锚点的编码往往无法捕获所有训练区间,將未裁剪视频切分为滑动窗口会导致宝贵的训练区间被丢弃。为克服这些限制,我们引入 PESFormer,一种基于视觉转换器架构的简单而有效的模型,用于实现点到区间的表情检测。PESFormer 采用直接时间戳编码(DTE)方法取代锚点,实现对每个时间戳的二元分类,而非优化整个真实值,从而以离散时间戳形式保留所有训练区间。为最大化训练区间的利用,我们通过将未裁剪训练视频零填充以创建统一的、持续更长的视频来增强预处理过程,而非采用滑动窗口方法。广泛的定性和定量评估表明,PESFormer 在 CAS(ME)^2、CAS(ME)^3 和 SAMM-LV 三个数据集上超越现有技术,实现了最佳性能。
引用
@article{arxiv.2410.18695,
title = {PESFormer: Boosting Macro- and Micro-expression Spotting with Direct Timestamp Encoding},
author = {Wang-Wang Yu and Kai-Fu Yang and Xiangrui Hu and Jingwen Jiang and Hong-Mei Yan and Yong-Jie Li},
journal= {arXiv preprint arXiv:2410.18695},
year = {2024}
}