中文

Naver 在 ActivityNet Challenge 2019 中的提交——任务 B 主动说话人检测 (AVA)

声音 2019-06-26 v1 计算机视觉与模式识别 音频与语音处理

摘要

本报告描述了我们提交给 CVPR 2019 上 ActivityNet Challenge 的作品。我们使用基于 3D 卷积神经网络(CNN)的前端以及时序卷积与 LSTM 分类器的集成来预测可见人物是否在说话。我们的结果显示在 AVA-ActiveSpeaker 数据集上相较基线有显著提升。

关键词

引用

@article{arxiv.1906.10555,
  title  = {Naver at ActivityNet Challenge 2019 -- Task B Active Speaker Detection (AVA)},
  author = {Joon Son Chung},
  journal= {arXiv preprint arXiv:1906.10555},
  year   = {2019}
}