Action Reimagined:用于动态人体动作的文本到姿态视频编辑
计算机视觉与模式识别
2024-03-13 v1
摘要
我们提出了一种新颖的文本到姿态视频编辑方法 ReimaginedAct。现有的视频编辑任务仅限于属性、背景和风格的改变,而我们的方法旨在预测视频中开放端的人体动作变化。此外,我们的方法不仅能接受直接的指令性文本提示,还能接受“如果……会怎样”的问题来预测可能的动作变化。ReimaginedAct 包含视频理解、推理和编辑模块。首先,利用大语言模型(LLM)获取针对指令或问题的合理回答,随后该回答用于:(1) 提示 Grounded-SAM 生成相关个体的边界框;(2) 检索我们收集的一组用于编辑人体动作的姿态视频。检索到的姿态视频和检测到的个体随后被用于修改从原始视频中提取的姿态。我们还采用了一个时间步混合模块,以确保编辑后的视频除必要修改外保留其原始内容。为促进文本到姿态视频编辑的研究,我们引入了一个新的评估数据集 WhatifVideo-1.0。该数据集包含了涵盖不同难度水平的多种场景视频,以及相应的问题和文本提示。实验结果表明,现有的视频编辑方法难以处理人体动作编辑,而我们的方法能够实现有效的动作编辑,甚至能基于反事实问题进行想象性编辑。
引用
@article{arxiv.2403.07198,
title = {Action Reimagined: Text-to-Pose Video Editing for Dynamic Human Actions},
author = {Lan Wang and Vishnu Boddeti and Sernam Lim},
journal= {arXiv preprint arXiv:2403.07198},
year = {2024}
}