McSc:基于自我批判层次推理的运动校正偏好对齐视频生成
计算机视觉与模式识别
2025-12-01 v1
摘要
文本到视频(T2V)生成在生成与文本提示高度一致的高质量视频方面取得了显著进展,但在将合成视频与细腻的人类偏好对齐方面仍面临挑战,这源于人类判断的主观性和多维性。现有的视频偏好对齐方法依赖高成本的人类标注,或利用代理指标预测偏好,这缺乏对人类偏好逻辑的理解。此外,这些方法通常直接将T2V模型与整体偏好分布对齐,忽略了诸如运动动力学和视觉质量等潜在冲突维度,这可能导致模型倾向于低运动内容。为此,我们提出了运动校正自我批判层次推理(McSc),一个三阶段强化学习框架,用于稳健的偏好建模和对齐。首先,ScDR(Self-critic维度推理)训练生成式奖励模型(RM),使用自我批判推理链分解偏好为各维度评估,以实现可靠学习。其次,为实现整体视频比较,我们引入了HCR(Hierarchical Comparative Reasoning),进行结构化多维推理并获得层次化奖励监督。最后,基于RM偏好视频,我们提出了运动校正直接偏好优化(McDPO),以动态重新加权对齐目标以减轻对低运动内容的偏见。实验表明,McSc在人类偏好对齐方面表现出色,生成的视频具有高运动动力学。
引用
@article{arxiv.2511.22974,
title = {McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning},
author = {Qiushi Yang and Yingjie Chen and Yuan Yao and Yifang Men and Huaizhuo Liu and Miaomiao Cui},
journal= {arXiv preprint arXiv:2511.22974},
year = {2025}
}