MTGA:面向基于事件的唇读的多视角时间粒度对齐聚合
计算机视觉与模式识别
2025-04-14 v2
摘要
唇读是利用说话人唇部动作的视觉信息来识别单词和句子。现有的基于事件的唇读解决方案将不同帧率分支集成以学习不同粒度的时空特征。然而,将事件聚合到事件帧不可避免地导致帧内细粒度时间信息的丢失。为补救此缺陷,我们提出一种新颖框架,称为多视角时间粒度对齐聚合(MTGA)。具体而言,我们首先提出一种新颖的事件表示方法,即时间分段体素图表,其中最显著的局部体素在时间上被连接成图表。随后,我们设计基于时间粒度对齐的时空融合模块,其中从事件帧中提取的全局空间特征,以及体素图表中包含的局部相对空间和时间特征被有效地对齐和集成。最后,我们设计了一个包含位置编码的时间聚合模块,以捕获局部绝对空间和全局时间信息。实验表明,我们的方法优于基于事件和基于视频的唇读基线方法。
引用
@article{arxiv.2404.11979,
title = {MTGA: Multi-View Temporal Granularity Aligned Aggregation for Event-Based Lip-Reading},
author = {Wenhao Zhang and Jun Wang and Yong Luo and Lei Yu and Wei Yu and Zheng He and Jialie Shen},
journal= {arXiv preprint arXiv:2404.11979},
year = {2025}
}