MLLM-VADStory:基于领域知识的多模态大语言模型用于视频广告剧情洞察
多媒体
2026-01-14 v1 计算机视觉与模式识别
摘要
我们提出 MLLM-VADStory,一种新颖的领域知识引导的多模态大语言模型(MLLM)框架,用于系统化地量化和生成视频广告剧情理解的洞察。该框架核心思想是,广告叙事由功能意图构成,每个场景单元执行不同的交际功能,在秒级内传递产品和品牌相关信息。MLLM-VADStory 将广告分割为功能单元, 使用一种新颖的广告专业功能角色分类法对每个单元的功能进行分类,然后聚合跨广告的功能序列,以恢复数据驱动的剧情结构。将该框架应用于4个行业子细分领域的5万条社交媒体视频广告,我们发现基于故事的创意会提高视频保留率,并推荐表现最佳的剧情弧线以指导广告商进行创意设计。我们的框架展示了利用领域知识引导 MLLM 生成视频广告剧情可扩展洞察的价值,使其成为理解一般视频创意的通用工具。
引用
@article{arxiv.2601.07850,
title = {MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights},
author = {Jasmine Yang and Poppy Zhang and Shawndra Hill},
journal= {arXiv preprint arXiv:2601.07850},
year = {2026}
}