中文

E-VAds:面向多模态大语言模型的电商短视频理解基准

计算机视觉与模式识别 2026-05-26 v3

摘要

电商短视频是网络视频行业中高收入的细分领域,其特点是目标驱动格式和密集的多模态信号。当前模型通常难以处理这些视频,因为现有基准主要关注通用任务,而忽略了商业意图的推理。在这项工作中,我们首先提出了一个多模态信息密度评估框架来量化该领域的复杂性。我们的评估揭示,与主流数据集相比,电商内容在视觉、音频和文本模态上表现出显著更高的密度,为视频理解建立了一个更具挑战性的前沿。为弥补这一空白,我们引入了电商视频广告基准(E-VAds),这是首个专门为电商短视频理解设计的基准。我们从淘宝精选了3,961个高质量视频,涵盖广泛的产品类别,并使用多智能体系统生成了19,785个开放式问答对。这些问题被组织成两个主要维度,即感知与认知以及推理,包含五个不同的任务。最后,我们开发了E-VAds-R1,一个基于强化学习的推理模型,其特点是名为MG-GRPO的多粒度奖励设计。该策略为早期探索提供平滑指导,同时为专家级精度创建非线性激励。实验结果表明,E-VAds-R1仅用几百个训练样本就在商业意图推理上实现了109.2%的性能提升。

关键词

引用

@article{arxiv.2602.08355,
  title  = {E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs},
  author = {Xianjie Liu and Yiman Hu and Liang Wu and Ping Hu and Yixiong Zou and Jian Xu and Bo Zheng},
  journal= {arXiv preprint arXiv:2602.08355},
  year   = {2026}
}

备注

Accepted by ICML2026