中文

TalkNCE:以说话感知对比学习改进主动说话人检测

计算机视觉与模式识别 2023-09-22 v1 声音 音频与语音处理

摘要

本工作的目标是主动说话人检测 (ASD),即判断一系列视频帧中人物是否在说话的任务。先前工作通过探索网络架构处理该任务,而对有效表示的学习关注较少。本文提出 TalkNCE,一种新颖的说话感知对比损失。该损失仅应用于屏幕上人物实际说话的部分完整片段,鼓励模型通过语音与面部运动的自然对应学习有效表示。我们的损失可与训练 ASD 模型的现有目标联合优化,无需额外监督或训练数据。实验表明,我们的损失可轻松集成到现有 ASD 框架中并提升其性能。我们的方法在 AVA-ActiveSpeaker 和 ASW 数据集上取得最先进性能。

关键词

引用

@article{arxiv.2309.12306,
  title  = {TalkNCE: Improving Active Speaker Detection with Talk-Aware Contrastive Learning},
  author = {Chaeyoung Jung and Suyeon Lee and Kihyun Nam and Kyeongha Rho and You Jin Kim and Youngjoon Jang and Joon Son Chung},
  journal= {arXiv preprint arXiv:2309.12306},
  year   = {2023}
}