LiFT:利用人类反馈实现文本到视频模型对齐
计算机视觉与模式识别
2025-03-06 v3
摘要
近期文本到视频(T2V)生成模型的发展展示了令人印象深刻的能力。然而,这些模型在将合成视频与人类偏好对齐方面仍然不足(例如准确反映文本描述),这尤其难以解决,因为人类偏好是主观的,难以形式化为客观函数。现有研究训练依赖人工标注评分的视频质量评估模型用于视频评估,但忽略了评估背后的推理,限制了其捕捉细微人类标准的能力。此外,利用基于视频的人类反馈对齐T2V模型尚未被探索。因此,本文提出了LiFT,第一个旨在利用人类反馈实现T2V模型对齐的方法。具体而言,我们首先构建了一个人类评分标注数据集LiFT-HRA,包含约10k个人工标注,每个标注包括一个评分及其对应的理由。基于此,我们训练了一个奖励模型LiFT-Critic来有效学习奖励函数,作为人类判断的代理,衡量给定视频与人类期望之间的对齐程度。最后,我们利用学习到的奖励函数,通过最大化奖励加权似然来对齐T2V模型。作为案例研究,我们将该流程应用于CogVideoX-2B,结果表明微调后的模型在所有16项指标上均优于CogVideoX-5B,凸显了人类反馈在提升合成视频对齐性和质量方面的潜力。
引用
@article{arxiv.2412.04814,
title = {LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment},
author = {Yibin Wang and Zhiyu Tan and Junyan Wang and Xiaomeng Yang and Cheng Jin and Hao Li},
journal= {arXiv preprint arXiv:2412.04814},
year = {2025}
}
备注
Project page: https://codegoat24.github.io/LiFT