中文

LAVE:基于大语言模型的智能体辅助与语言增强视频编辑

人机交互 2024-02-29 v1 人工智能 计算与语言 多媒体

摘要

视频创作日益流行,然而编辑所需的专业知识和努力常常给初学者带来障碍。在本文中,我们探索将大语言模型(LLM)集成到视频编辑工作流中以减少这些障碍。我们的设计愿景体现在LAVE中,这是一个新颖的系统,提供基于LLM的智能体辅助和语言增强的编辑功能。LAVE自动为用户素材生成语言描述,作为使LLM能够处理视频并协助编辑任务的基础。当用户提供编辑目标时,智能体规划并执行相关操作以实现这些目标。此外,LAVE允许用户通过智能体或直接UI操作来编辑视频,提供了灵活性并允许手动细化智能体操作。我们的用户研究包括八名参与者,从新手到熟练编辑者,证明了LAVE的有效性。结果还揭示了用户对所提出的LLM辅助编辑范式的看法,以及它如何影响用户的创造力和共同创作感。基于这些发现,我们提出了设计启示,以指导未来智能体辅助内容编辑的发展。

关键词

引用

@article{arxiv.2402.10294,
  title  = {LAVE: LLM-Powered Agent Assistance and Language Augmentation for Video Editing},
  author = {Bryan Wang and Yuliang Li and Zhaoyang Lv and Haijun Xia and Yan Xu and Raj Sodhi},
  journal= {arXiv preprint arXiv:2402.10294},
  year   = {2024}
}

备注

Paper accepted to the ACM Conference on Intelligent User Interfaces (ACM IUI) 2024