InstructVideo:利用人类反馈指导视频扩散模型
计算机视觉与模式识别
2023-12-21 v1 人工智能
机器学习
多媒体
摘要
扩散模型已成为视频生成的事实标准范式。然而,它们依赖于质量参差不齐的网络规模数据,往往导致生成结果在视觉上不吸引人且与文本提示不一致。为了解决这个问题,我们提出InstructVideo,通过奖励微调利用人类反馈来指导文本到视频扩散模型。InstructVideo有两个关键要素:1)为了减轻由完整DDIM采样链生成所导致的奖励微调成本,我们将奖励微调重新定义为编辑。通过利用扩散过程破坏采样的视频,InstructVideo仅需部分推断DDIM采样链,从而降低微调成本并提高微调效率。2)为了缓解缺乏专门用于人类偏好的视频奖励模型的问题,我们重新利用已建立的图像奖励模型,例如HPSv2。为此,我们提出了分段视频奖励(Segmental Video Reward)——一种基于分段稀疏采样提供奖励信号的机制,以及时间衰减奖励(Temporally Attenuated Reward)——一种在微调期间缓解时间建模退化的方法。大量的定性和定量实验验证了在InstructVideo中使用图像奖励模型的实用性和有效性,显著提高了生成视频的视觉质量,同时不损害泛化能力。代码和模型将公开提供。
引用
@article{arxiv.2312.12490,
title = {InstructVideo: Instructing Video Diffusion Models with Human Feedback},
author = {Hangjie Yuan and Shiwei Zhang and Xiang Wang and Yujie Wei and Tao Feng and Yining Pan and Yingya Zhang and Ziwei Liu and Samuel Albanie and Dong Ni},
journal= {arXiv preprint arXiv:2312.12490},
year = {2023}
}
备注
Project page: https://instructvideo.github.io/