中文

面向物理可信视频生成的层次化细粒度偏好优化

计算机视觉与模式识别 2025-08-15 v1

摘要

近期视频生成技术的发展使得能够创建高质量、视觉上引人入目的数据。然而,在需要真实性和准确性的应用中,生成遵循物理定律的视频仍是一个关键挑战。本文提出了PhysHPO(Hierarchical Cross-Modal Direct Preference Optimization),一种新型框架,用于层次化细粒度偏好对齐,以解决此挑战,实现对物理可信视频生成的细粒度偏好对齐。PhysHPO在四个层次粒度上优化视频对齐:a) 实例层面,对齐整体视频内容与输入提示;b) 状态层面,使用边界帧作为锚点确保时间一致性;c) 运动层面,建模运动轨迹以实现真实动态;d) 语义层面,维持叙事与视觉之间的逻辑一致性。鉴于现实世界视频是物理现象最好的映射,我们进一步引入了自动化数据选择管道,高效识别并利用现有大规模文本-视频数据集中的“优质数据”,从而消除对昂贵且耗时的 datasets 构建需求。在针对物理专注和通用能力基准的广泛实验中,结果表明PhysHPO显著改进了物理可信度和先进模型的整体视频生成质量。据我们所知,这是首个针对视频生成探索细粒度偏好对齐和数据选择的工作,为更真实、更符合人类偏好的视频生成范式铺平了道路。

关键词

引用

@article{arxiv.2508.10858,
  title  = {Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation},
  author = {Harold Haodong Chen and Haojian Huang and Qifeng Chen and Harry Yang and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:2508.10858},
  year   = {2025}
}

备注

Project Page: https://haroldchen19.github.io/PhysHPO-Page/