ViDiC:视频差异描述
计算机视觉与模式识别
2026-03-25 v3
摘要
理解动态场景之间视觉差异的能力需要对构成性、空间和时间变化进行比较感知——这一能力在现有视觉语言系统中仍未得到充分探索。虽然先前的图像差异描述(Image Difference Captioning, IDC)工作已使模型能够描述静态图像之间的语义变化,但这些方法无法捕捉运动连续性、事件演变或随时间的编辑一致性。我们提出ViDiC(Video Difference Captioning)任务及其对应的ViDiC-1K数据集,旨在评估多模态大语言模型(MLLM)对视频对之间相似性和差异性进行细粒度描述的能力。ViDiC-1K包含1000组精选视频对,标注了超过4000项比较清单项目,涵盖七个类别:主体、风格、背景、摄影、运动、位置及播放技术。为确保可靠评估,我们提出了双清单框架,基于LLM作为评判器协议,分别衡量相似性和差异性的准确性。在19个代表性多模态模型实验中,结果显示这些模型在比较描述和差异感知能力存在显著差距。我们希望ViDiC-1K能成为一个具有挑战性的基准,为推动视频理解、编辑意识以及多模态智能中的比较推理奠定坚实基础。
引用
@article{arxiv.2512.03405,
title = {ViDiC: Video Difference Captioning},
author = {Jiangtao Wu and Shihao Li and Zhaozhou Bian and Jialu Chen and Runzhe Wen and An Ping and Yiwen He and Jiakai Wang and Yuanxing Zhang and Jiaheng Liu},
journal= {arXiv preprint arXiv:2512.03405},
year = {2026}
}