中文

SVLTA:基于合成视频情境的视觉语言时间对齐基准测试

计算机视觉与模式识别 2025-04-09 v1

摘要

视觉语言时间对齐是实现人类在现实场景中动态识别与认知的关键能力。虽然现有研究聚焦于捕捉视觉语言相关性,但因时间分布偏倚、标注不精确和表述不足性等限制,面临挑战。为实现公平评估和全面探索,本文旨在从时间维度检验模型实现视觉语言对齐的能力,具体聚焦于其在时序一致 manner 上将视觉情景与语言语境同步对齐的能力。作为初步步骤,我们对现有基准进行统计分析,从分解视角揭示现有挑战。为此,我们提出SVLTA(Synthetic Vision-Language Temporal Alignment),即通过在仿真环境中设计可行的控制生成方法导出的合成视觉语言时间对齐数据集。该方法考虑常识知识、可操作动作和受限过滤,生成合理、多样且分布均衡的数据,用于诊断性评估。我们的实验通过在时序问答、分布迁移敏感性和时序对齐适应性中的评估,揭示诊断性洞见。

关键词

引用

@article{arxiv.2504.05925,
  title  = {SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation},
  author = {Hao Du and Bo Wu and Yan Lu and Zhendong Mao},
  journal= {arXiv preprint arXiv:2504.05925},
  year   = {2025}
}

备注

CVPR 2025. The first two authors contributed equally