EmoVid:面向情感导向视频理解与生成的多模态情感视频数据集
计算机视觉与模式识别
2025-11-17 v1
摘要
情感在基于视频的表达中起着关键作用,但现有视频生成系统主要关注低层次视觉指标,而忽略了情感维度。尽管情感分析在视觉领域取得了进展,但视频社区仍缺乏专门的数据资源,以桥接情感理解与生成任务,尤其是针对风格化和非真实感的情境。为此,本文引入 EmoVid,这是第一个为创意媒体(包括卡通动画、电影片段和动画贴纸)专门设计的、带情感标注的多模态视频数据集。每个视频都标注了情感标签、视觉属性(亮度、饱和度、色调)以及文本描述。通过系统化分析,我们揭示了视觉特征与情感感知之间在不同视频形式下的空间和时间模式。基于这些洞见,我们开发了一种情感条件视频生成技术,通过微调 Wan2.1 模型实现。结果表明,针对文本到视频和图像到视频任务,所生成视频在定量指标和视觉质量方面均显著提升。EmoVid 为情感视频计算建立了新的基准。我们的工作不仅为艺术化风格视频的视觉情感分析提供了宝贵洞见,还为增强视频生成中的情感表达提供了实用方法。
引用
@article{arxiv.2511.11002,
title = {EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation},
author = {Zongyang Qiu and Bingyuan Wang and Xingbei Chen and Yingqing He and Zeyu Wang},
journal= {arXiv preprint arXiv:2511.11002},
year = {2025}
}
备注
15 pages, 12 figures. Accepted as an Oral presentation at AAAI 2026. For code and dataset, see https://zane-zyqiu.github.io/EmoVid