通过解缠影响函数细化多维视频奖励模型
机器学习
2026-05-28 v1
摘要
随着Text-to-Video (T2V) 生成模型的不断演进,视频评估的复杂性迫切需要在各种维度上进行细粒度评估。为此,近期工作 focus on developing Multidimensional Video Reward Models (MVRMs),以更好地与人类视觉感知的多面性相吻合。然而,培训有效的MVRMs面临着视频数据复杂性的根本性挑战。在本工作中,我们识别出一种关键现象,称为维度异构性:训练样本在各评估维度上的可靠性会在显著程度上变化,即样本可能为一个目标提供可靠的监督,同时对另一个目标引发高监督风险。因此,基于全局标量指标进行筛选的数据中心方法对于T2V任务而言是不恰当的。为此,我们提出一种解缠影响框架,高效估计维度特定的监督风险。利用该框架,我们引入两种维度解缠细化策略:维度解缠修剪(Dimension-Disentangled Pruning),删除极端高风险样本;维度解缠重加权(Dimension-Disentangled Reweighting),软性地降低高风险监督的权重。广泛的实验表明,我们的解缠策略显著优于全局筛选基线,产生与真实答案更强烈对齐的奖励模型。
引用
@article{arxiv.2605.28203,
title = {Refining Multidimensional Video Reward Models via Disentangled Influence Functions},
author = {Muyao Wang and Zeke Xie and Hideki Nakayama},
journal= {arXiv preprint arXiv:2605.28203},
year = {2026}
}