中文

基于面部-语音关联的听觉可视化主动说话人检测:用于体hetically 记录

多媒体 2025-06-24 v1 声音 音频与语音处理

摘要

听觉可视化主动说话人检测(ASD)通常通过建模声学和视觉语音线索的时间同步来实现。然而,在体hetically 记录中,由于遮挡、运动模糊和不利的声学条件,同步基于的方法的效果受到限制。本文提出了一种新框架,完全利用跨模态面部-语音关联来确定说话人活动。将一个现有的面部-语音关联模型集成到基于 Transformer 的编码器中,后者通过动态加权每个帧的视觉质量来聚合面部身份信息。该系统随后与前端话语分割方法耦合,形成一个完整的 ASD 系统。本工作表明,提出的系统 Self-Lifting for audiovisual active speaker detection(SL-ASD),在某些情况下实现与参数密集型同步基于方法相当的性能,甚至超过这些方法,同时显著减少可学习参数,从而验证了在具有挑战性的体hetically 场景下,用灵活的生物识别关联取代严格的听觉可视化同步建模的可行性。

关键词

引用

@article{arxiv.2506.18055,
  title  = {Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings},
  author = {Jason Clarke and Yoshihiko Gotoh and Stefan Goetze},
  journal= {arXiv preprint arXiv:2506.18055},
  year   = {2025}
}

备注

Accepted to EUSIPCO 2025. 5 pages, 1 figure. To appear in the Proceedings of the 33rd European Signal Processing Conference (EUSIPCO), September 8-12, 2025, Palermo, Italy