从内容到受众:面向广播电视分析的多模态标注框架
计算机视觉与模式识别
2026-03-31 v1 人工智能
计算机与社会
摘要
自动化的广播电视内容语义标注面临独特挑战,包括结构化的音视频构图、领域特定的编辑模式以及严格的运营约束。虽然多模态大语言模型(MLLMs)已在通用视频理解方面展现出强大能力,但在广播特定场景下,不同管道架构和输入配置的比较效果在实证层面仍不充分刻画。本文针对意大利语境下的广播电视新闻,系统评估了多模态标注管道的效果。我们构建了一个针对广播电视的特定基准数据集,对影格在四个语义维度上进行标注:视觉环境分类、主题分类、敏感内容检测和命名实体识别。评估了两种不同的管道架构,涵盖九个前沿模型,包括 Gemini 3.0 Pro、LLaMA 4 Maverick、Qwen-VL 系列和 Gemma 3,在逐步丰富的输入策略下综合视觉信号、自动语音识别、说话人分割和元数据。实验结果表明,视频输入带来的提升对模型而言至关重要:大型模型有效利用了时间连续性,而小型模型在扩展的多模态上下文下显示性能下降,可能由于 token 负载过大。除基准测试外,所选管道被部署在 14 集完整广播集数上,分钟级标注与意大利媒体公司提供的归一化受众测量数据集成,使我们能够对主题层面的受众敏感性和代际参与差异进行相关性分析,展示了该框架在内容驱动的受众分析中具有实际可行性。
引用
@article{arxiv.2603.26772,
title = {From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics},
author = {Paolo Cupini and Francesco Pierri},
journal= {arXiv preprint arXiv:2603.26772},
year = {2026}
}