追溯时间之箭:诊断视频大语言模型中的时序信息流
计算机视觉与模式识别
2026-05-11 v1 计算与语言
摘要
时间之箭(Arrow-of-Time, AoT)任务是通过识别时序不可逆性来判断视频是正向播放还是反向播放的任务。人类几乎能准确完成这一任务,但前沿的视频大语言模型(Video-LLMs)仅略高于随机水平。这种差距引出了一个关键问题:视觉主干是否未能编码时序信息,还是信息瓶颈存在于视频大语言模型架构的其他位置?我们通过从视频大语言模型中分离视觉编码器,追踪编码器、投影器和大语言模型之间的时序信息流。我们发现,具有显式时序建模的视频导向编码器编码出强烈的时序信号,而帧导向编码器则不行。然而,当视频导向表示通过标准的视频大语言模型架构传递时,性能常常会崩溃,这揭示了时序信息流的瓶颈。我们识别出投影器设计是一个关键因素:Q-Former会破坏时序信息,而保持时间的MLP投影显著改善了大语言模型获取此类信息的能力。我们进一步的层级分析显示编码器各层之间的时序表示动态。基于这些发现,我们构建了一个集成时序感知视频导向编码器、保持时间的投影器以及AoT监督的视频大语言模型,在AoT上达到98.1%的准确率,并在VITATECS-Direction和TVBench等更广泛的时序推理任务中提升了最高6.0分和1.3分。我们的结果表明,视频大语言模型的时序推理既需要有效的时序编码,也需要可靠地将此类信息传递给大语言模型。
引用
@article{arxiv.2605.07568,
title = {Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs},
author = {Peitao Han and Fei Cheng and Lis K. Pereira and Qianying Liu and Shigeru Kitazawa},
journal= {arXiv preprint arXiv:2605.07568},
year = {2026}
}