中文

EgoVIS@CVPR: PAIR-Net: 通过预训练视听融合与对齐损失增强自我中心视角说话人检测

计算机视觉与模式识别 2025-09-30 v3

摘要

自我中心视角视频中的主动说话人检测(ASD)面临独特挑战,原因在于视点不稳定、运动模糊和屏幕外语音源——在这些条件下,传统的以视觉为中心的方法性能显著下降。我们提出了 PAIR-Net(Pretrained Audio-Visual Integration with Regularization Network,基于预训练视听集成与正则化网络),这是一种有效的模型,它将部分冻结的 Whisper 音频编码器与微调的 AV-HuBERT 视觉骨干网络相集成,以稳健地融合跨模态线索。为抵消模态不平衡,我们引入了模态间对齐损失,以同步音频和视觉表示,从而实现跨模态更一致的收敛。在不依赖多说话人上下文或理想正面视角的情况下,PAIR-Net 在 Ego4D ASD 基准上取得了 76.6% mAP 的 SOTA 性能,分别比 LoCoNet 和 STHG 高出 8.2% 和 12.9% mAP。我们的结果突显了预训练音频先验和基于对齐的融合在实际自我中心条件下实现稳健 ASD 的价值。

关键词

引用

@article{arxiv.2506.02247,
  title  = {EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss},
  author = {Yu Wang and Juhyung Ha and David J. Crandall},
  journal= {arXiv preprint arXiv:2506.02247},
  year   = {2025}
}

备注

4 pages, 1 figure, and 1 table