中文

OmniNFT:面向联合音视频生成的模态感知 Omni Diffusion 强化学习

计算机视觉与模式识别 2026-05-13 v1 人工智能

摘要

近期的联合音视频生成取得了显著进展,但实际应用需要保证强大的单模态保真度、跨模态对齐和细粒度同步。强化学习 (RL) 为这一问题提供了有前景的范式,但其对多目标和多模态联合音视频生成的扩展尚未探索。我们深入分析后发现,将 RL 应用于此的主要障碍源于:(i) 多目标优势不一致,即多模态输出的优势在同一组内并不总是一致; (ii) 多模态梯度不平衡,即视频分支梯度泄漏到负责单模态生成的浅层音频层; (iii) 统一信任分配,即细粒度跨模态对齐区域未获得有效的探索。这些短板表明,单一全局优势的常规 RL 精调策略常常导致亚最优结果。为此,我们提出 OmniNFT,一种具三大关键创新的模态感知在线扩散 RL 框架:(1) 模态级优势路由,将独立的 per-reward 优势路由到各自的模态生成分支; (2) 层级梯度手术, selectively detach 视频分支梯度在浅层音频层,同时保留用于跨模态交互的梯度; (3) 区域级损失重加权,将策略优化导向与音视频同步和细粒度对齐相关的关键区域。 在 JavisBench 和 VBench 上的大量实验表明,OmniNFT 在音频和视频感知质量、跨模态对齐和音视频同步方面实现了全面性改进。

关键词

引用

@article{arxiv.2605.12480,
  title  = {OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation},
  author = {Guohui Zhang and XiaoXiao Ma and Jie Huang and Hang Xu and Hu Yu and Siming Fu and Yuming Li and Zeyue Xue and Lin Song and Haoyang Huang and Nan Duan and Feng Zhao},
  journal= {arXiv preprint arXiv:2605.12480},
  year   = {2026}
}

备注

Project page: https://zghhui.github.io/OmniNFT/