DiffusionCinema:文本到空中摄影
机器人学
2026-01-27 v1
摘要
我们提出了一种新型的无人机协助创意捕捉系统,利用扩散模型解释高层次自然语言提示,并自动生成用于电影视频记录的最优飞行轨迹。用户无需手动驾驶无人机,只需描述所需的拍摄角度(例如:"从右侧缓慢环绕我,揭示背景瀑布")。我们的系统将提示词连同机载相机初始视觉快照一起编码,扩散模型对满足场景几何与拍摄语义的合理时空运动计划进行采样。生成的飞行轨迹随后由无人机自动执行,以记录与提示匹配的平滑、可重复的视频片段。用户评估使用NASA-TLX,显示我们界面(M = 21.6)的整体工作量显著低于传统遥控器(M = 58.1),显示出显著的感知 effort 减少。心理需求(M = 11.5 vs. 60.5)和挫败感(M = 14.0 vs. 54.5)也明显低于其他系统,确认了在自主文本驱动飞行控制中明显的可用性优势。该项目展示了一种新的交互范式:文本到电影飞行,其中扩散模型充当"创意操作员",将故事意图直接转换为空中运动。
引用
@article{arxiv.2601.17412,
title = {DiffusionCinema: Text-to-Aerial Cinematography},
author = {Valerii Serpiva and Artem Lykov and Jeffrin Sam and Aleksey Fedoseev and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2601.17412},
year = {2026}
}