CineTechBench: 电影摄影技术理解与生成基准
计算机视觉与模式识别
2025-05-22 v1
摘要
电影摄影是电影制作和欣赏的基石,通过视觉元素如摄影机运动、镜头构图和布光来塑造氛围、情感和叙事。尽管多模态大语言模型(MLLMs)和视频生成模型取得了近期进展,但当前模型对电影摄影技术的理解和再现能力仍 largely 未被探索,受限于专家标注数据的匮乏。为弥补这一空白,我们提出了CineTechBench,一个基于资深电影摄影专家在关键电影摄影维度上进行精确人工标注的先驱性基准。我们的基准涵盖七个基本方面——镜头尺度、镜头角度、构图、摄影机运动、布光、色彩和焦距——包含600多张标注电影图像和120个带有清晰电影摄影技术的电影片段。对于理解任务,我们设计了问答对和标注描述来评估MLLMs解释和说明电影摄影技术的能力。对于生成任务,我们评估先进视频生成模型在给定文本提示或关键帧等条件下重构电影级摄影机运动的能力。我们对15+个MLLMs和5+个视频生成模型进行了大规模评估。结果揭示了当前模型的局限性和电影摄影理解与生成在自动化电影制作和欣赏中的未来方向。代码和基准可在https://github.com/PRIS-CV/CineTechBench获取。
引用
@article{arxiv.2505.15145,
title = {CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation},
author = {Xinran Wang and Songyu Xu and Xiangxuan Shan and Yuxuan Zhang and Muxi Diao and Xueyan Duan and Yanhua Huang and Kongming Liang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2505.15145},
year = {2025}
}
备注
Under review