中文

基于专家混合模型的视频关系检测

计算机视觉与模式识别 2024-03-08 v1 机器学习

摘要

图像和视频中视觉信息的神经网络机器理解面临两个主要挑战。首先,在视觉与语言之间存在计算和推理鸿沟,使难以准确确定给定主体所作用的对象,并通过语言进行表示。其次,由单一单巨型神经网络训练的分类器往往缺乏稳定性和泛化能力。为克服这些挑战,我们引入了 MoE-VRD,这是一种利用专家混合模型的视觉关系检测新方法。MoE-VRD 以 < 主体、谓词、客体 > 元组的形式识别语言三元组,从而从视觉处理中提取关系。利用近期在视觉关系检测方面的进展,MoE-VRD 解决了在主体(发作)和客体(被作用)之间建立关系中对动作识别的要求。与单一单巨型网络不同,MoE-VRD 采用多个小型模型作为专家,其输出被聚合。MoE-VRD 中的每个专家都专注于视觉关系学习和对象标记。通过利用稀疏门控的专家混合模型,MoE-VRD 实现了条件计算,显著提升了神经网络容量而不会增加计算复杂度。我们的实验结果表明,条件计算能力和专家混合方法的可扩展性导致其在视觉关系检测方面的性能优于现有的 SOTA 方法。

关键词

引用

@article{arxiv.2403.03994,
  title  = {Video Relationship Detection Using Mixture of Experts},
  author = {Ala Shaabana and Zahra Gharaee and Paul Fieguth},
  journal= {arXiv preprint arXiv:2403.03994},
  year   = {2024}
}