ExpressEdit:结合自然语言与草图的视频编辑
人机交互
2024-03-27 v1 人工智能
摘要
信息性视频是向新手和专家解释概念性和程序性知识的重要来源。在制作信息性视频时,编辑者通过叠加文本/图像或裁剪片段来编辑视频,以提升视频质量并使其更具吸引力。然而,视频编辑可能困难且耗时,尤其是对于经常难以表达和实现其编辑想法的视频编辑新手。为应对这一挑战,我们首先探索了如何利用多模态——自然语言(NL)和草图(人类用于表达的自然模态)来支持视频编辑者表达视频编辑想法。我们从10位视频编辑者那里收集了176种编辑命令的多模态表达,揭示了在描述编辑意图时自然语言和草图的使用模式。基于这些发现,我们提出了ExpressEdit,一个通过自然语言文本和在视频帧上绘制草图来编辑视频的系统。该系统由LLM和视觉模型驱动,解释自然语言命令中的(1)时间、(2)空间和(3)操作引用,以及草图中的空间引用。系统实现解释后的编辑,用户随后可以迭代。一项观察性研究(N=10)表明,ExpressEdit增强了新手视频编辑者表达和实现其编辑想法的能力。该系统允许参与者基于用户的多模态编辑命令生成编辑,并支持对编辑命令进行迭代,从而更高效地执行编辑并产生更多想法。这项工作为未来视频编辑的多模态界面和基于AI的流水线设计提供了见解。
引用
@article{arxiv.2403.17693,
title = {ExpressEdit: Video Editing with Natural Language and Sketching},
author = {Bekzat Tilekbay and Saelyne Yang and Michal Lewkowicz and Alex Suryapranata and Juho Kim},
journal= {arXiv preprint arXiv:2403.17693},
year = {2024}
}
备注
22 pages, 5 figures, to be published in ACM IUI 2024