中文

COEF-VQ:基于级联多模态大语言模型框架的成本高效视频质量理解

计算机视觉与模式识别 2025-07-04 v2 人工智能

摘要

近期,随着多模态大语言模型(MLLM)技术的不断发展,利用其进行视频理解能力在不同分类任务上已成为可能。在实际应用中,我们面临着巨大的 GPU 资源需求,如果需要在线部署 MLLM。为此,本文提出了 COEF-VQ,一种新颖的级联 MLLM 框架,旨在提升短视频平台上视频质量理解的效果,同时优化计算效率。我们的方法集成了基于熵的预筛选阶段,其中使用轻量级模型评估不确定性,对案例进行选择性过滤,再将其传递给计算资源更密集的 MLLM 进行最终评估。通过优先对高不确定性样本进行深入分析,我们的框架显著减少了 GPU 使用,同时保持了完整 MLLM 部署的强大分类性能。为证明 COEF-VQ 的有效性,我们将该框架部署在短视频平台的视频管理平台(VMP)上,并在与视频质量理解相关的两个内部任务上进行详细实验。我们表明,COEF-VQ 在这两个任务中相较于离线评估带来了显著的性能提升,有效提升了平台安全性,资源消耗有限,在不影响用户参与度的前提下,将不当内容视频的观看率降低了 9.9%,并通过在线 A/B 测试验证了实际效果。上线后监控数据确认了持续的改进,验证了其实际应用价值。

关键词

引用

@article{arxiv.2412.10435,
  title  = {COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework},
  author = {Xin Dong and Sen Jia and Ming Rui Wang and Yan Li and Zhenheng Yang and Bingfeng Deng and Hongyu Xiong},
  journal= {arXiv preprint arXiv:2412.10435},
  year   = {2025}
}