TRAVL:提升视频语言模型判断物理不合理性的配方
计算机视觉与模式识别
2025-10-10 v1 人工智能
摘要
尽管现代视频生成模型在视觉保真性方面取得了显著进展,但它们经常产生违反直观物理法则的序列,如物体漂浮、瞬移或以违背因果性的方式变形。人类可以轻松检测此类不合理性,但目前尚无鲁棒的方法用于定量评估视频的物理真实性。在本工作中,我们探讨了视频语言模型(VLM)能否被训练作为物理合理性的可靠判官。我们发现,现有的VLM在识别物理违规方面存在困难,暴露了其在时序和因果推理方面的根本局限。为此,我们引入TRAVL,一种微调配方,结合平衡的训练数据集和轨迹感知注意力模块,以改进运动编码和判别能力。为更严格地评估物理推理,我们提出ImplausiBench,即包含300个视频(150个真实视频,150个生成视频)的基准,消除语言偏见,孤立视觉时序理解。性能以标准的人类判断和更严格的LLM判官指标报告。总体而言,TRAVL和ImplausiBench提供了一个统一的框架,用于探索和改进多模态模型中的物理合理性,揭示了视觉时序理解中一个具有挑战性且鲜有人关注的方面。
引用
@article{arxiv.2510.07550,
title = {TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility},
author = {Saman Motamed and Minghao Chen and Luc Van Gool and Iro Laina},
journal= {arXiv preprint arXiv:2510.07550},
year = {2025}
}