音视频解析中模态偏置的探究
计算机视觉与模式识别
2022-11-14 v2 多媒体
声音
音频与语音处理
图像与视频处理
摘要
我们关注音视觉视频解析(AVVP)问题,该问题涉及检测带有时间边界的音频与视觉事件标签。该任务尤其具有挑战性,因为它仅以弱监督方式提供每个视频的事件标签包。现有的 AVVP 最优模型采用混合注意力网络(HAN)为音频与视觉两种模态生成跨模态特征,并采用注意力池化模块聚合预测的音频与视觉片段级事件概率以得到视频级事件概率。我们对现有 HAN 架构中的模态偏置进行了详细分析,即某一模态在预测过程中被完全忽略。我们还提出了 HAN 中特征聚合的一种变体,与现有 HAN 模型相比,在片段级和事件级上分别为视觉事件和音视觉事件带来约 2% 和 1.6% 的 F 值绝对提升。
引用
@article{arxiv.2203.16860,
title = {Investigating Modality Bias in Audio Visual Video Parsing},
author = {Piyush Singh Pasi and Shubham Nemani and Preethi Jyothi and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2203.16860},
year = {2022}
}
备注
Work under review for ICASSP 2023