QuAVF:面向Ego4D Talking to Me挑战赛的质量感知音视频融合
计算机视觉与模式识别
2023-07-03 v1
摘要
本技术报告描述了我们 QuAVF@NTU-NVIDIA 提交给 Ego4D Talking to Me (TTM) Challenge 2023 的方案。基于从 TTM 任务及所提供数据集中观察到的现象,我们提出使用两个独立模型分别处理输入视频与音频。如此一来,我们可利用所有带标签的训练数据,包括那些无边界框标签的数据。此外,我们利用来自人脸关键点预测模型的人脸质量分数来过滤噪声人脸输入数据。该人脸质量分数还被用于我们提出的质量感知融合中,以整合两个分支的结果。凭借简洁的架构设计,我们的模型在测试集上取得了 67.4% 的平均精度均值(mAP),在排行榜上排名第一,并大幅优于基线方法。代码见:https://github.com/hsi-che-lin/Ego4D-QuAVF-TTM-CVPR23
引用
@article{arxiv.2306.17404,
title = {QuAVF: Quality-aware Audio-Visual Fusion for Ego4D Talking to Me Challenge},
author = {Hsi-Che Lin and Chien-Yi Wang and Min-Hung Chen and Szu-Wei Fu and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2306.17404},
year = {2023}
}
备注
1st place at Ego4D Talking to Me (TTM) Challenge 2023