AdsQA:面向广告视频理解的基准
计算机视觉与模式识别
2025-09-11 v1
摘要
大语言模型(LLM)正迈向类人智能的关键步伐。同时,随着数学和编程等特定领域问题的不断涌现,这些通用模型正通过学习更深入的专业知识不断演进。因此,进一步丰富知识型LLM的专门化应用已成为时下热点,尽管收集高质量数据并具备意想不到的且富有信息量的任务仍具挑战。本文提出将广告视频作为检验LLM在常规视觉领域感知之外能力的挑战性测试基准。我们的动机是充分利用广告视频特有的线索丰富、信息密集等特征,例如营销逻辑、说服策略和观众参与度。我们的贡献有三方面:(1)据我们所知,这是首次尝试以精心设计的任务评估LLM。我们贡献AdsQA,一套源自1,544个广告视频、包含10,962个片段、总时长达22.7小时的挑战性广告视频 QA 基准,包含5个挑战性任务。(2)我们提出ReAd-R,即一种受DeepSeek-R1风格强化学习驱动的模型,可反思问题并通过奖励导向优化生成答案。(3)我们在AdsQA上对14个顶级LLM进行基准测试,ReAd-R实现了超越搭载长链推理能力的强大竞争者的领先表现。
引用
@article{arxiv.2509.08621,
title = {AdsQA: Towards Advertisement Video Understanding},
author = {Xinwei Long and Kai Tian and Peng Xu and Guoli Jia and Jingxuan Li and Sa Yang and Yihua Shao and Kaiyan Zhang and Che Jiang and Hao Xu and Yang Liu and Jiaheng Ma and Bowen Zhou},
journal= {arXiv preprint arXiv:2509.08621},
year = {2025}
}
备注
ICCV-2025