按需编辑:基于多粒度用户控制的视频字幕编辑
计算机视觉与模式识别
2024-08-09 v3 多媒体
摘要
以符合用户请求的自然语言自动叙述视频,即可控视频字幕生成任务,可帮助人们按期望意图管理海量视频。然而,现有工作存在两个不足:1)控制信号为单粒度,无法满足多样的用户意图;2)视频描述以单轮方式生成,无法进一步编辑以满足动态需求。在本文中,我们提出一种新颖的\textbf{视}\textbf{频}\textbf{字}\textbf{幕}\textbf{编}\textbf{辑}(VCE)任务,以在多粒度用户请求引导下自动修订已有视频描述。受人类写作-修订习惯启发,我们将用户指令设计为关键三元组 \{\textit{操作, 位置, 属性}\},以覆盖从粗粒度到细粒度的多样用户需求。为推进 VCE 任务,我们\textit{自动}构建了一个开放域基准数据集 VATEX-EDIT,并\textit{手动}收集了一个电商数据集 EMMAD-EDIT。我们进一步提出了一个专门的小规模模型(即 OPA),与两个通用大型多模态模型进行比较,以对该新任务进行详尽分析。在评估方面,我们采用综合考虑字幕流畅度、指令-字幕一致性和视频-字幕对齐性的全面指标。实验揭示了细粒度多模态语义理解与处理的任务挑战。我们的数据集、代码和评估工具可在 https://github.com/yaolinli/VCE 获取。
引用
@article{arxiv.2305.08389,
title = {Edit As You Wish: Video Caption Editing with Multi-grained User Control},
author = {Linli Yao and Yuanmeng Zhang and Ziheng Wang and Xinglin Hou and Tiezheng Ge and Yuning Jiang and Xu Sun and Qin Jin},
journal= {arXiv preprint arXiv:2305.08389},
year = {2024}
}
备注
Accepted by ACM MM 2024