面向视频问答的行动与对象路径
计算机视觉与模式识别
2024-12-02 v1 计算与语言
摘要
本文介绍了用于视频问答任务中域外泛化的行动与对象路径(AOPath)。AOPath利用大型预训练模型的特征来增强泛化性,而无需在未见域上进行显式训练。灵感来自人类大脑,AOPath将预训练特征分解为行动特征和对象特征,随后通过独立的推理路径加以处理。它利用一种新模块将域外特征转换为域无关特征,而无需引入任何可训练权重。我们在TVQA数据集上验证了所提出的方法,该数据集根据类型划分为多个子集,以促进对泛化性的评估。所提出的方法在域外和域内数据集上分别优于常规分类器5%和4%,也优于涉及数百万参数训练的先前方法,而所提出的方法只训练很少的参数。
引用
@article{arxiv.2411.19434,
title = {Actions and Objects Pathways for Domain Adaptation in Video Question Answering},
author = {Safaa Abdullahi Moallim Mohamud and Ho-Young Jung},
journal= {arXiv preprint arXiv:2411.19434},
year = {2024}
}