MAAS:用于活跃说话人检测的多模态分配方法
计算机视觉与模式识别
2021-10-06 v2
摘要
活跃说话人检测需要对多模态线索进行稳健整合。尽管单个模态可近似求解,但唯有显式融合音频与视觉特征并建模其时间演进,方能获得准确预测。尽管该问题本质为多模态,现有方法仍聚焦于对个体说话人的短期视听特征进行建模与融合,常在帧级别进行。本文提出一种新颖的活跃说话人检测方法,直接针对问题的多模态本质,并提供直观策略:将场景中潜在说话人的独立视觉特征分配给先前检测到的语音事件。我们的实验表明,由单帧构建的小型图数据结构可近似瞬时视听分配问题。此外,该初始图的时间扩展在 AVA-ActiveSpeaker 数据集上以 88.8% 的 mAP 达到了新的 state-of-the-art。
引用
@article{arxiv.2101.03682,
title = {MAAS: Multi-modal Assignation for Active Speaker Detection},
author = {Juan León-Alcázar and Fabian Caba Heilbron and Ali Thabet and Bernard Ghanem},
journal= {arXiv preprint arXiv:2101.03682},
year = {2021}
}