中文

看谁在说话:真实场景中的活跃说话人检测

计算机视觉与模式识别 2021-08-18 v1 声音 音频与语音处理 图像与视频处理

摘要

在这项工作中,我们提出了一个用于真实场景中活跃说话人检测的新型音视频数据集。当说话人的面部可见且声音可听时,被视为活跃。尽管活跃说话人检测是许多音视频任务的关键预处理步骤,但目前尚无用于评估活跃说话人检测性能的自然人类语音数据集。因此,我们整理了 Active Speakers in the Wild (ASW) 数据集,其包含带有密集语音活动标签的视频和共现的语音片段。视频和可听片段的时间戳从 VoxConverse(一个由真实场景视频组成的现有说话人日记化数据集)中解析并采用。从视频中提取人脸轨迹,并基于 VoxConverse 的时间戳以半自动方式标注活跃片段。我们在该数据集上评估了两个参考系统(一个自监督系统和一个全监督系统),以提供 ASW 的基线性能。进行了跨域评估,以展示训练数据中配音视频的负面影响。

关键词

引用

@article{arxiv.2108.07640,
  title  = {Look Who's Talking: Active Speaker Detection in the Wild},
  author = {You Jin Kim and Hee-Soo Heo and Soyeon Choe and Soo-Whan Chung and Yoohwan Kwon and Bong-Jin Lee and Youngki Kwon and Joon Son Chung},
  journal= {arXiv preprint arXiv:2108.07640},
  year   = {2021}
}

备注

To appear in Interspeech 2021. Data will be available from https://github.com/clovaai/lookwhostalking