基础即一切?用于视频对话的双重时间定位
计算机视觉与模式识别
2024-11-15 v2 人工智能
多媒体
摘要
在视频对话响应生成领域,理解视频内容和对话历史的时间细微差别至关重要。当前研究一方面严重依赖大规模预训练的视觉-语言模型,常常忽视时间动态;另一方面则深入挖掘视频内的时空关系,但需要复杂的对象轨迹预提取并忽视了对话的时间动态。本文介绍了双重时间定位增强视频对话模型(DTGVD),该模型策略性地设计以融合两种主流方法的优势。它通过预测对话轮次特定的时间区域、相应地过滤视频内容,并将响应同时基于视频和对话上下文进行定位,从而强调双重时间关系。DTGVD的一个突出特点是其对时间顺序相互作用的增强关注。通过识别并利用不同对话轮次之间的依赖关系,它捕捉到了更细微的对话动态。为进一步加强视频与对话时间动态之间的对齐,我们实施了一种列表式对比学习策略。在此框架内,精确定位的轮次-片段对被指定为正样本,而较不精确的配对则被归类为负样本。这种精细化的分类随后被输入到我们整体的端到端响应生成机制中。使用AVSD@DSTC-7和AVSD@DSTC-8数据集的评估证明了我们方法的优越性。
引用
@article{arxiv.2410.05767,
title = {Grounding is All You Need? Dual Temporal Grounding for Video Dialog},
author = {You Qin and Wei Ji and Xinze Lan and Hao Fei and Xun Yang and Dan Guo and Roger Zimmermann and Lizi Liao},
journal= {arXiv preprint arXiv:2410.05767},
year = {2024}
}