中文

面向可扩展视频多模态大语言模型的不可篡改时间奖励

计算机视觉与模式识别 2025-02-18 v1 计算与语言

摘要

在追求卓越视频处理多模态大语言模型的过程中,我们遇到了一根本性悖论:\'反标尺律\',即数据量更多、模型更大反而导致性能下降。本研究揭示了罪魁:\'时间篡改\',这是一种模型捷足为屈的现象,即模型仅关注特定帧,忽略了整个视频叙事。本文系统地建立了时间篡改的完整理论,从强化学习视角对其进行定义,提出用于评估此类偏离的时序困惑(Temporal Perplexity, TPL)得分,并构思了缓解时间篡改的不可篡改时间奖励(Unhackable Temporal Rewarding, UTR)框架。无论是在理论上还是实证实验中,TPL都证明是一个可靠的时序建模质量指标,与帧激活模式高度相关。大量实验表明,UTR不仅抵消了时间篡改,更显著提升了视频理解能力。本工作不仅推动了视频AI系统的发展,也阐明了在多模态大语言模型开发中,对齐代理奖励与真实目标的关键重要性。

关键词

引用

@article{arxiv.2502.12081,
  title  = {Unhackable Temporal Rewarding for Scalable Video MLLMs},
  author = {En Yu and Kangheng Lin and Liang Zhao and Yana Wei and Zining Zhu and Haoran Wei and Jianjian Sun and Zheng Ge and Xiangyu Zhang and Jingyu Wang and Wenbing Tao},
  journal= {arXiv preprint arXiv:2502.12081},
  year   = {2025}
}

备注

Accepted by ICLR2025. Project Page: https://ahnsun.github.io/UTR/