中文

LongVALE:面向时间感知全模态长视频的视觉-音频-语言-事件基准

计算机视觉与模式识别 2025-03-21 v3 计算与语言 机器学习 多媒体

摘要

尽管视频理解取得了显著进展,但大多数工作仍局限于粗粒度或视觉单模态视频任务。然而,现实世界的视频包含视觉、音频和语音等全模态信息,以及一系列事件构成连贯的叙事。缺乏带有细粒度事件标注的多模态视频数据以及手动标注的高成本,是实现全面全模态视频感知的主要障碍。为此,我们提出了包括高质量多模态视频过滤、语义连贯全模态事件边界检测以及跨模态关联感知事件描述生成的自动化流水线。如此,我们首次提出了 LongVALE——世界上第一个视觉-音频-语言-事件理解基准,包含 105K 条带有精确时间边界和详尽关系感知描述的全模态事件,涵盖 8.4K 部高质量长视频。进一步,我们构建了基线模型,首次利用 LongVALE 使视频大语言模型(LLM)能够进行全模态细粒度时序视频理解。大量实验表明,LongVALE 在推动全面多模态视频理解方面具有有效性和巨大潜力。

关键词

引用

@article{arxiv.2411.19772,
  title  = {LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos},
  author = {Tiantian Geng and Jinrui Zhang and Qingni Wang and Teng Wang and Jinming Duan and Feng Zheng},
  journal= {arXiv preprint arXiv:2411.19772},
  year   = {2025}
}

备注

Accepted by CVPR2025