面向视频问答的模块化混合注意力网络
计算机视觉与模式识别
2023-11-23 v1 人工智能
计算与语言
机器学习
摘要
在多模态机器学习任务中,由于任务本身的复杂性,网络结构在大多数情况下以复杂方式组装。整体架构可根据各模块旨在实现的目标划分为若干逻辑部分。随着信息表征模态数量的增加,为处理来自不同模态的数据并协调不同信息类型的融合而构建专用子网络,已成为一个繁琐且代价高昂的问题。本文提出一种方法,以可复用、可组合的神经网络单元来辅助问题处理;通过串联或并联这些单元,多模态机器学习任务中艰巨的网络构建将以更为直接的方式完成。此外,通过单元间的参数共享(权重复制),空间复杂度将显著降低。我们在三个常用数据集上进行了实验;与若干视频问答基线相比,我们的方法取得了令人印象深刻的性能。
引用
@article{arxiv.2311.12866,
title = {Modular Blended Attention Network for Video Question Answering},
author = {Mingjie Zhou},
journal= {arXiv preprint arXiv:2311.12866},
year = {2023}
}
备注
I will not add others' names since this work has not been published