将视频视为时间序列:用于 VideoQA 的时序一致性与可变性发现
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
视频问答(VideoQA)是一种需要精细理解视觉内容和时序动态的复杂视频语言任务。传统的 Transformer 架构虽在整合多模态数据方面有效,但常通过位置编码简化时序动态,难以捕捉视频序列中非线性相互作用。本文引入时间三元组转换器(T3T),一种新型架构,模型化时序一致性和时序可变性。T3T 集成了三个关键组件:时序平滑(TS)、时序差分(TD)和时序融合(TF)。TS 模块采用布朗桥(Brownian Bridge)捕捉平滑连续的时序过渡,而 TD 模块识别并编码视频内容中的显著时序变化和突变。随后,TF 模块将这些时序特征与文本线索融合,促进更深层的上下文理解和响应准确性。通过在多个 VideoQA 基准数据集上的广泛测试,证明了 T3T 的有效性。我们的实验结果凸显了在提高基于视频问答准确性和深度方面,对时序建模的细致方法的重要性。
关键词
引用
@article{arxiv.2504.05783,
title = {Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA},
author = {Zijie Song and Zhenzhen Hu and Yixiao Ma and Jia Li and Richang Hong},
journal= {arXiv preprint arXiv:2504.05783},
year = {2025}
}