超越原始视频:基于大型多模态模型理解编辑后的视频
计算机视觉与模式识别
2024-09-30 v2
摘要
新兴的视频大型多模态模型(video LMMs)在 VQA(视觉问答)形式上对通用视频理解取得了显著提升,典型情况下是针对由摄像机拍摄的原始视频。然而,在实际应用中,很大比例的视频是编辑后的视频,例如用户通常在发布到社交媒体平台之前对原始视频进行剪辑和添加特效/修改。编辑后的视频通常拥有高浏览量,但目前的视频 LMM 基准(如 ActivityNet-QA 或 VideoChatGPT 基准)尚未覆盖这类视频。本文我们利用流行的短视频平台(如 TikTok)上的编辑视频,构建了一个覆盖四种典型编辑类别的视频 VQA 基准(命名为 EditVid-QA),包括特效、搞笑、表情包和游戏类别。搞笑和表情包视频需要细致的理解和高层次的推理,而特效和游戏则评估人工设计的理解能力。大多数开源视频 LMM 在 EditVid-QA 基准上表现不佳,表明社交媒体上编辑短视频与常规原始视频之间存在巨大的领域差距。为提高 LMM 的泛化能力,我们基于 Panda-70M/WebVid 原始视频和规模较小的 TikTok/CapCut 编辑视频收集了训练集,这显著提升了在 EditVid-QA 基准上的性能,表明高质量训练数据的有效性。我们还识别出现有评估协议中使用 GPT-3.5 判官的一个严重问题,即“抱歉”攻击,即以“抱歉”式的机械答案可获得极高的 GPT 判官评分(例如在 VideoChatGPT 评估协议中,正确性得分可超过 4.3)。为避免“抱歉”攻击,我们使用 GPT-4 判官和关键词过滤进行评估。该数据集已发布于 https://github.com/XenonLamb/EditVid-QA。
引用
@article{arxiv.2406.10484,
title = {Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model},
author = {Lu Xu and Sijie Zhu and Chunyuan Li and Chia-Wen Kuo and Fan Chen and Xinyao Wang and Guang Chen and Dawei Du and Ye Yuan and Longyin Wen},
journal= {arXiv preprint arXiv:2406.10484},
year = {2024}
}