LASER:以唇部关键点辅助的说话人检测,提高鲁棒性
计算机视觉与模式识别
2025-11-27 v2 机器学习
摘要
主动说话人检测(Active Speaker Detection, ASD)旨在识别复杂视觉场景中的说话者。虽然人类天然依赖唇音同步,但现有的 ASD 模型在唇部运动与音频不同步时常误分类非说话实例。为此,我们提出以唇部关键点辅助的说话人检测(Lip landmark Assisted Speaker dEtection for Robustness, LASER),显式地在训练中融入唇部关键点,以引导模型注意力聚焦于与说话相关的区域。给定面部轨迹,LASER 提取视觉特征并将 2D 唇部关键点编码为密集图。为处理低分辨率或遮挡等失效情况,我们引入辅助一致性损失,以对齐唇部感知和面部-only 预测,无需在测试时使用关键点检测器。LASER 在多个领域内和跨域基准上超越了最先进的模型。为进一步评估在真实条件下的鲁棒性,我们引入 LASER-bench,这是一个包含不同背景噪声水平现代视频剪辑的精选数据集。在高噪声子集上,LASER 相较于 LoCoNet 和 TalkNet 提升了 3.3 和 4.3 个 mAP 点,显示出对真实世界声学挑战的强大韧性。
关键词
引用
@article{arxiv.2501.11899,
title = {LASER: Lip Landmark Assisted Speaker Detection for Robustness},
author = {Le Thien Phuc Nguyen and Zhuoran Yu and Yong Jae Lee},
journal= {arXiv preprint arXiv:2501.11899},
year = {2025}
}
备注
WACV 2026