中文

PISCES: 通过最优传输对齐奖励实现无标注文本到视频后训练

计算机视觉与模式识别 2026-02-03 v1

摘要

文本到视频 (T2V) 生成旨在合成与输入文本语义对齐的高视觉质量和时序一致性视频。基于奖励的后训练已成为提高生成视频质量和语义对齐性的有前景方向。然而,近期方法要么依赖大规模人类偏好标注,要么针对预训练视觉语言模型产生的错位嵌入进行操作,导致可扩展性有限或监督不佳。我们提出 PISCES\texttt{PISCES},一种通过 novel Dual Optimal Transport (OT)-对齐奖励模块解决上述限制的无标注后训练算法。为使奖励信号与人类判断相匹配,PISCES\texttt{PISCES} 使用OT在分布层面和离散token层面桥接文本和视频嵌入,使奖励监督实现两个目标:(i) 分布层面的OT对齐质量奖励,捕捉整体视觉质量和时序一致性;(ii) 离散token层面的OT对齐语义奖励,强制文本和视频token之间实现语义、时空对应。就目前知晓而言,PISCES\texttt{PISCES} 是首次通过OT视角改善无标注奖励监督在生成性后训练中的效果。在短视频和长视频生成上进行实验表明,PISCES\texttt{PISCES} 在VBench上的质量和语义分数均优于无标注和有标注方法,人类偏好研究进一步验证了其有效性。我们展示了Dual OT-对齐奖励模块与多种优化范式兼容,包括直接反向传播和强化学习微调。

关键词

引用

@article{arxiv.2602.01624,
  title  = {PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards},
  author = {Minh-Quan Le and Gaurav Mittal and Cheng Zhao and David Gu and Dimitris Samaras and Mei Chen},
  journal= {arXiv preprint arXiv:2602.01624},
  year   = {2026}
}