中文

UniCon+: ICTCAS-UCAS在ActivityNet Challenge 2022中AVA-ActiveSpeaker任务的提交方案

计算机视觉与模式识别 2022-06-23 v1 声音 音频与语音处理

摘要

本报告简要介绍了我们在ActivityNet Challenge 2022的AVA主动说话人检测(ASD)任务上获胜方案的说明。我们的基础模型UniCon+继续构建于先前工作之上,即统一上下文网络(UniCon)和扩展UniCon,它们专为鲁棒的场景级ASD而设计。我们通过一个简单的基于GRU的模块来增强该架构,该模块允许通过读取和更新操作使重复身份的信息跨场景流动。我们在AVA-ActiveSpeaker测试集上报告了94.47% mAP的最佳结果,该结果在今年挑战赛排行榜上继续排名第一,并显著推进了当前最优水平。

关键词

引用

@article{arxiv.2206.10861,
  title  = {UniCon+: ICTCAS-UCAS Submission to the AVA-ActiveSpeaker Task at ActivityNet Challenge 2022},
  author = {Yuanhang Zhang and Susan Liang and Shuang Yang and Shiguang Shan},
  journal= {arXiv preprint arXiv:2206.10861},
  year   = {2022}
}

备注

5 pages, 3 figures; technical report for AVA Challenge (see https://research.google.com/ava/challenge.html) at the International Challenge on Activity Recognition (ActivityNet), CVPR 2022