视觉变换叙述
计算机视觉与模式识别
2024-06-12 v2
摘要
人类能够根据生活经验,从表面状态差异(如地面湿润)自然推理出变换描述(如下雨)。本文提出一种新的视觉推理任务,用于在真实场景中测试这种变换推理能力,称为视觉变换叙述(Visual Transformation Telling, VTT)。给定一系列状态(即图像),VTT 要求描述每两个相邻状态之间发生的变换。与聚焦于表面状态推理的现有视觉推理任务不同,VTT 的优势在于捕捉状态间差异背后的潜在成因,例如动作或事件。我们从两个现有教学视频数据集 CrossTask 和 COIN 中收集了一个新颖数据集以支持变换推理研究,包含 13,547 个样本。每个样本包含关键状态图像及其变换描述。我们的数据集涵盖多样的真实活动,为训练与评估提供了丰富资源。为构建 VTT 的初始基准,我们测试了若干模型,包括传统视觉叙事方法(CST、GLACNet、Densecap)与先进多模态大语言模型(LLaVA v1.5-7B、Qwen-VL-chat、Gemini Pro Vision、GPT-4o 和 GPT-4)。实验结果表明,即便最先进的模型在 VTT 上仍面临挑战,显示出大量待改进空间。
引用
@article{arxiv.2305.01928,
title = {Visual Transformation Telling},
author = {Wanqing Cui and Xin Hong and Yanyan Lan and Liang Pang and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2305.01928},
year = {2024}
}