Naver 在 ActivityNet Challenge 2019 中的提交——任务 B 主动说话人检测 (AVA)
声音
2019-06-26 v1 计算机视觉与模式识别
音频与语音处理
摘要
本报告描述了我们提交给 CVPR 2019 上 ActivityNet Challenge 的作品。我们使用基于 3D 卷积神经网络(CNN)的前端以及时序卷积与 LSTM 分类器的集成来预测可见人物是否在说话。我们的结果显示在 AVA-ActiveSpeaker 数据集上相较基线有显著提升。
引用
@article{arxiv.1906.10555,
title = {Naver at ActivityNet Challenge 2019 -- Task B Active Speaker Detection (AVA)},
author = {Joon Son Chung},
journal= {arXiv preprint arXiv:1906.10555},
year = {2019}
}