将动漫视频生成对齐人类反馈
计算机视觉与模式识别
2025-06-25 v2
摘要
动漫视频生成面临数据稀缺及特殊运动模式的挑战,导致运动失真和闪烁性瑕疵,进而产生与人类偏好的错位。现有的奖励模型主要为真实世界视频设计,无法捕捉动漫特有的外观及一致性需求。为此,本文提出一种通过人类反馈增强动漫视频生成的管道。具体而言,我们构建了首个针对动漫视频的多维奖励数据集,包含 3 万 余份人工标注样本,纳入人类对视觉外观与视觉一致性的偏好。据此,我们开发了AnimeReward——一种强大的奖励模型,采用针对不同评估维度的专用视觉语言模型,以引导偏好对齐。进一步,我们引入 Gap-Aware Preference Optimization (GAPO) 一种新型训练方法,显式纳入偏好差距以提升对齐性能与效率。大量实验表明,AnimeReward 在现有奖励模型中取得优异表现,GAPO 的加入在定量基准及人类评估中实现优异对齐,充分展示了本管道在提升动漫视频质量方面的有效性。我们的代码与数据集已公开于 https://github.com/bilibili/Index-anisora。
引用
@article{arxiv.2504.10044,
title = {Aligning Anime Video Generation with Human Feedback},
author = {Bingwen Zhu and Yudong Jiang and Baohan Xu and Siqian Yang and Mingyu Yin and Yidi Wu and Huyang Sun and Zuxuan Wu},
journal= {arXiv preprint arXiv:2504.10044},
year = {2025}
}
备注
10 pages, 7 figures, 7 tables