面向短视频内容治理的推理增强型领域自适应多模态大语言模型预训练
计算机视觉与模式识别
2025-11-12 v3
摘要
短视频平台发展迅速,识别不当内容的重要性日益凸显。现有方法通常为每种问题类型分别训练独立的小型分类模型,这需要大量人工标注数据且缺乏跨问题泛化能力。我们提出了一种推理增强的多模态大语言模型(MLLM)预训练范式,用于统一的不当内容检测。为解决短视频内容与 MLLM 原始预训练数据之间的分布差距以及复杂的问题定义,我们引入了三种针对性的预训练任务:(1)\textit{标题(Caption)},以增强 MLLM 对视频细节的感知;(2)\textit{视觉问答(VQA)},以加深 MLLM 对问题定义和标注准则的理解;(3)\textit{思维链(Chain-of-Thought, CoT)},以增强 MLLM 的推理能力。实验结果表明,我们的预训练方法显著提升了 MLLM 在零样本和监督微调(SFT)设置下的性能。此外,我们的预训练模型展现出对新兴、先前未见问题的强大泛化能力。
引用
@article{arxiv.2509.21486,
title = {Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance},
author = {Zixuan Wang and Yu Sun and Hongwei Wang and Baoyu Jing and Xiang Shen and Xin Dong and Zhuolin Hao and Hongyu Xiong and Yang Song},
journal= {arXiv preprint arXiv:2509.21486},
year = {2025}
}
备注
Camera Ready for EMNLP 2025