基于对比学习的注意力驱动混合架构用于视频-based MPAA 评级预测
计算机视觉与模式识别
2025-09-09 v1 机器学习
摘要
随着跨平台视觉内容消费的快速增长,自动化视频分类以满足 MPAA 评级体系(G、PG、PG-13、R)的年龄适宜性标准变得至关重要。传统方法面临大量标记数据需求、泛化性差和特征学习效率低下的挑战。为此,我们采用对比学习以提高判别力和适应性,探索三种框架:实例判别、情境对比学习和多视角对比学习。我们的混合架构集成了 LRCN(CNN+LSTM)主干网络和巴哈达努注意力机制,在情境对比学习框架下实现了最先进的性能,准确率为 88%,F1 分数为 0.8815。通过融合 CNN 用于空间特征提取、LSTM 用于时序建模和注意力机制用于动态帧优先级,模型在细粒度边缘区分中表现出色,例如区分 PG-13 和 R 级内容。我们评估了各种对比损失函数(包括 NT-Xent、NT-logistic 和 Margin Triplet)的性能,展示了所提出架构的鲁棒性。为确保实际应用,该模型被部署为 Web 应用程序,用于实时 MPAA 评级分类,为流媒体平台的自动化内容合规提供了高效解决方案。
引用
@article{arxiv.2509.06826,
title = {Video-Based MPAA Rating Prediction: An Attention-Driven Hybrid Architecture Using Contrastive Learning},
author = {Dipta Neogi and Nourash Azmine Chowdhury and Muhammad Rafsan Kabir and Mohammad Ashrafuzzaman Khan},
journal= {arXiv preprint arXiv:2509.06826},
year = {2025}
}
备注
12 pages, 9 figures