中文

BIAS:基于身体的可解释主动说话人方法

计算机视觉与模式识别 2024-12-09 v1

摘要

最先进的主动说话人检测(ASD)方法高度依赖音频和面部特征,在野外场景中难以持续发挥作用。虽然这些方法在标准 AVA-ActiveSpeaker 数据集上取得好结果,但近期野外 ASD 数据集(WASD)显示了此类模型的局限性,催生了新的方法需求。为此,我们提出 BIAS 模型,首次将音频、面部与身体信息融合,以准确预测在不同/挑战性条件下的主动说话人。此外,我们设计 BIAS 以提供可解释性,提出将 Squeeze-and-Excitation 块的新用途用于注意力热力图创建与特征重要性评估。为完整的可解释性方案,我们标注了 ASD 相关动作数据集(ASD-Text),以微调 ViT-GPT2 进行文本场景描述,以补充 BIAS 的可解释性。结果表明,BIAS 在身体特征至关重要的挑战性条件下(哥伦比亚、开放环境及 WASD)实现最先进表现,在 AVA-ActiveSpeaker 上表现竞争,因为面部对 ASD 影响更大。BIAS 的可解释性还揭示了在不同设置下更相关的特征/方面,使其成为可解释 ASD 模型领域的强基准模型,项目地址为 https://github.com/Tiago-Roxo/BIAS。

关键词

引用

@article{arxiv.2412.05150,
  title  = {BIAS: A Body-based Interpretable Active Speaker Approach},
  author = {Tiago Roxo and Joana C. Costa and Pedro R. M. Inácio and Hugo Proença},
  journal= {arXiv preprint arXiv:2412.05150},
  year   = {2024}
}