中文

借助人类-AI 监督构建精确视频语言

计算机视觉与模式识别 2026-04-28 v2 人工智能 计算与语言 机器学习 多媒体

摘要

视频语言模型(VLM)通过自然语言学习推理动态视觉世界。我们引入一套开放数据集、基准测试和配方,实现可扩展的精确视频描述。首先,我们定义了用于描述主体、场景、运动、空间和摄像 dynamics 的结构化规范,依托数百项由专业视频创作者(如电影制作人)仔细定义的视觉原语。接下来,为筛选高质量描述,我们引入 CHAI(批判式人类-AI 监督),该框架中训练受训专家批判并修订模型生成的预描述为改进后的后描述。这种分工劳动通过将文本生成卸载至模型,使人类专注于验证,从而提高标注准确性和效率。此外,这些批判和 pre-与 post-描述之间的偏好为改进开源模型(Qwen3-VL)在描述生成、奖励建模和批判生成方面的提供了丰富的监督,通过 SFT、DPO 和推理时间扩展实现。我们的消融实验表明,监督框架确保批判质量(精确度、召回率和建设性)直接决定下游性能。仅凭有限的专家监督,所得模型便超越了闭源模型如 Gemini-3.1-Pro。最后,我们将该方法应用于为专业视频(如电影、广告、游戏)重新描述,并微调视频生成模型如 Wan,以更好地遵循最高可达 400 字的详细提示,在摄影师制作中实现更细致的控制,包括摄像机运动、角度、镜头、焦点、视点和构图。我们的结果表明,精确规格和人类-AI 监督是专业级视频理解和生成的关键。数据和代码均可在我们的项目页面上获取:https://linzhiqiu.github.io/papers/chai/

关键词

引用

@article{arxiv.2604.21718,
  title  = {Building a Precise Video Language with Human-AI Oversight},
  author = {Zhiqiu Lin and Chancharik Mitra and Siyuan Cen and Isaac Li and Yuhan Huang and Yu Tong Tiffany Ling and Hewei Wang and Irene Pi and Shihang Zhu and Ryan Rao and George Liu and Jiaxi Li and Ruojin Li and Yili Han and Yilun Du and Deva Ramanan},
  journal= {arXiv preprint arXiv:2604.21718},
  year   = {2026}
}

备注

CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/