面向医学教学视频中视觉提示时序答案定位的研究
计算机视觉与模式识别
2025-03-26 v6 人工智能
计算与语言
摘要
视频中的时序答案定位(TAGV)是从视频中的时序句子定位(TSGV)自然衍生出的一项新任务。给定一段未经裁剪的视频和一个文本问题,该任务旨在从视频中定位出能够在语义上回答该问题的匹配片段。现有方法倾向于采用基于视觉片段的问答(QA)方法,通过匹配由文本问题查询的视觉帧片段来形式化 TAGV 任务。然而,由于文本问题与视觉答案之间语义特征的弱相关性和巨大鸿沟,采用视觉片段预测器的现有方法在 TAGV 任务上表现不佳。为弥合这些鸿沟,我们提出了一种视觉提示文本片段定位(VPTSL)方法,该方法将带时间戳的字幕作为语篇,对输入文本问题执行文本片段定位,并将视觉高亮特征提示(prompt)入预训练语言模型(PLM)以增强联合语义表示。具体而言,利用上下文查询注意力在提取的文本与视觉特征之间执行跨模态交互。随后,通过视频-文本高亮获得用于视觉提示的高亮特征。为缓解文本与视觉特征间的语义差异,我们设计文本片段预测器,利用 PLM 对问题、字幕及被提示的视觉高亮特征进行编码。由此,TAGV 任务被形式化为预测与视觉答案匹配的字幕片段。在医学教学数据集 MedVidQA 上的大量实验表明,所提出的 VPTSL 在 mIOU 指标上以 28.36% 的大幅度优势超越最先进(SOTA)方法,证明了所提视觉提示与文本片段预测器的有效性。
引用
@article{arxiv.2203.06667,
title = {Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video},
author = {Bin Li and Yixuan Weng and Bin Sun and Shutao Li},
journal= {arXiv preprint arXiv:2203.06667},
year = {2025}
}
备注
8 pages, 6 figures, 3 tables