中文

基于同步化和面部-语音关联范式的集成方法,用于鲁棒的以太极录音中的主动说话人检测

多媒体 2025-08-15 v1 声音

摘要

以太极录音中的Audiovisual active speaker detection(ASD)面临频繁遮挡、运动模糊和音频干扰,这些因素削弱了lip movement与speech之间时间同步性的可辨识度。传统的同步化-based系统在干净条件下表现良好,但在一级人录音中会急剧下降。相反,基于面部-语音关联(FVA)的方法则抛弃同步化建模,转而采用跨模态生物识别匹配,能够抵抗瞬时视觉损坏,但在重叠语音或前端分段错误时会受到影响。本文提出一种简单而有效的集成方法,通过加权平均融合同步化依赖和同步化不可知模型的输出,从而在不引入复杂融合架构的情况下发挥两者的互补线索。还介绍了一种改进的预处理流程,用于优化集成集成。在Ego4D-AVD验证集上进行的实验表明,该集成在TalkNet和Light-ASD backbone上分别实现了70.2%和66.7%的平均精度(mAP)。进一步对面部图像质量和说话者遮蔽率进行分层的定性分析进一步论证了每个组件的互补优势。

关键词

引用

@article{arxiv.2508.10580,
  title  = {Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings},
  author = {Jason Clarke and Yoshihiko Gotoh and Stefan Goetze},
  journal= {arXiv preprint arXiv:2508.10580},
  year   = {2025}
}

备注

Accepted to SPECOM 2025, 13 pages, 4 figures. To appear in the Proceedings of the 27th International Conference on Speech and Computer (SPECOM) 2025, October 13-14, 2025, Szeged, Hungary