过滤-精炼:基于多模态大语言模型的级联系统用于工业级视频内容审核
机器学习
2025-07-24 v1
摘要
有效的内容审核对于视频平台保障用户体验和维护社区标准至关重要。虽然传统的视频分类模型能有效处理定义明确的审核任务,但它们在处理复杂场景(如隐晦的有害内容和上下文歧义)时表现不佳。多模态大语言模型(MLLM)凭借其卓越的跨模态推理和上下文理解能力,为这些局限性提供了有前景的解决方案。然而,两个关键挑战阻碍了它们的工业应用。首先,MLLM的高计算成本使得全面部署不切实际。其次,将生成式模型适配为判别式分类仍然是一个开放的研究问题。在本文中,我们首先介绍了一种高效的方法,利用极少的判别式训练数据将生成式MLLM转化为多模态分类器。为了实现工业级部署,我们随后提出了一种路由器-排序级联系统,该系统将MLLM与轻量级路由器模型集成。离线实验表明,我们基于MLLM的方法相比传统分类器,F1分数提升了66.50%,而仅需2%的微调数据。在线评估显示,我们的系统将自动内容审核量提高了41%,同时级联部署将计算成本降低到直接全面部署的1.5%。
引用
@article{arxiv.2507.17204,
title = {Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation},
author = {Zixuan Wang and Jinghao Shi and Hanzhong Liang and Xiang Shen and Vera Wen and Zhiqian Chen and Yifan Wu and Zhixin Zhang and Hongyu Xiong},
journal= {arXiv preprint arXiv:2507.17204},
year = {2025}
}
备注
Camera Ready for ACL 2025