中文

GateFusion:用于主动说话人检测的层次化门控跨模态融合

计算机视觉与模式识别 2025-12-18 v1

摘要

主动说话人检测(ASD)旨在识别每个视频帧中当前正在说话的人。大多数最先进的方法依赖于后期融合来组合视觉和音频特征,但后期融合往往难以捕获细粒度的跨模态交互,在不受约束的情景中对于实现稳健性能至关重要。本文我们引入GateFusion,一种新型架构,将强大的预训练单模态编码器与层次化门控融合解码器(HiGate)结合起来。HiGate通过在Transformer主干的多个层级上适应性地将一个模态的上下文特征注入另一个模态,受可学习的双模态条件门控指导,实现渐进式的多深度融合。为了进一步加强多模态学习,我们提出了两个辅助目标:蒙版对齐损失(MAL)以对齐单模态输出与多模态预测,以及过正惩罚(OPP)以抑制不正当的仅视频激活。GateFusion在多个具有挑战性的ASD基准测试上建立了新的最先进结果,分别在Ego4D-ASD、UniTalk和WASD基准测试上实现了77.8% mAP(+9.4%)、86.1% mAP(+2.9%)和96.1% mAP(+0.5%),并在AVA-ActiveSpeaker上实现竞争性能。离域实验表明了模型的泛化能力,而全面的消融实验显示了每个组件的互补优势。

关键词

引用

@article{arxiv.2512.15707,
  title  = {GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection},
  author = {Yu Wang and Juhyung Ha and Frangil M. Ramirez and Yuchen Wang and David J. Crandall},
  journal= {arXiv preprint arXiv:2512.15707},
  year   = {2025}
}

备注

accepted by WACV 2026