中文

LensCraft:你的专业虚拟摄影师

图形学 2025-06-03 v1 计算机视觉与模式识别

摘要

从独立电影制作人到动画工作室,数字创作者面临着一个持续的瓶颈:将他们的创意愿景转化为精确的摄像机运动。尽管计算机视觉和人工智能取得了重大进展,但当前的自动拍摄系统在机械执行与创意意图之间仍存在根本性的权衡。关键的是,几乎所有先前的工作都将主体简化为一个单一质点——忽略了其朝向和真实体积——严重限制了拍摄过程中的空间感知。LensCraft 通过模仿专业摄影师的专长来解决这一问题,采用数据驱动的方法,将摄影原则与实时适应动态场景的灵活性相结合。我们的解决方案结合了一个用于生成高保真训练数据的专用模拟框架,以及一个忠实于剧本同时感知主体体积和动态行为的先进神经模型。此外,我们的方法允许通过各种输入模态进行灵活控制,包括文本提示、主体轨迹与体积、关键点或完整的摄像机轨迹,为创作者提供了一个多功能工具,以按照他们的愿景指导摄像机运动。利用轻量级的实时架构,LensCraft 在保持高输出质量的同时,实现了显著降低的计算复杂度和更快的推理速度。在静态和动态场景中的广泛评估显示出了前所未有的准确性和连贯性,与 SOTA 模型相比,为智能摄像机系统设定了新的基准。扩展结果、完整数据集、模拟环境、训练好的模型权重和源代码均已在 LensCraft 网页上公开。

关键词

引用

@article{arxiv.2506.00988,
  title  = {LensCraft: Your Professional Virtual Cinematographer},
  author = {Zahra Dehghanian and Morteza Abolghasemi and Hossein Azizinaghsh and Amir Vahedi and Hamid Beigy and Hamid R. Rabiee},
  journal= {arXiv preprint arXiv:2506.00988},
  year   = {2025}
}