面向视频问答的基于领域特定细粒度启发式的视频语言基础模型提示
计算机视觉与模式识别
2024-10-15 v1 人工智能
摘要
视频问答(VideoQA)代表了视频理解与语言处理之间至关重要的交叉,需要进行精确推断以实现准确的推理。尽管多模态预训练模型和视频语言基础模型取得了进展,但这些系统常常在面对领域特定VideoQA时表现不佳,因其通用预训练目标难以满足特定推理需求。为弥合这一差距,本文引入HeurVidQA框架,利用领域特定实体-动作启发式来细化预训练的视频语言基础模型。我们将这些模型视为隐式知识引擎,采用领域特定实体-动作提示器引导模型聚焦于精确线索,从而增强推理能力。通过提供细粒度启发式,我们提高了模型识别和解释关键实体和动作的能力,从而提升了其推理能力。跨多个VideoQA数据集的广泛评估表明,我们的方法显著优于现有模型,凸显了将领域特定知识集成到视频语言模型中以实现更准确和上下文感知VideoQA的重要性。
引用
@article{arxiv.2410.09380,
title = {Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering},
author = {Ting Yu and Kunhao Fu and Shuhui Wang and Qingming Huang and Jun Yu},
journal= {arXiv preprint arXiv:2410.09380},
year = {2024}
}
备注
IEEE Transactions on Circuits and Systems for Video Technology