VideoAVE:一个多属性视频到文本属性值提取数据集与基准模型
计算机视觉与模式识别
2025-08-19 v1 计算与语言
摘要
属性值提取 (AVE) 对结构化电子商务产品信息至关重要。然而,现有的 AVE 数据集主要局限于文本到文本或图像到文本设置,缺乏对产品视频的支持、属性覆盖范围和公开可获取性。为此,我们引入了 VideoAVE,这是第一个跨越14个不同领域、覆盖172个独特属性的视频到文本电子商务 AVE 数据集。为确保数据质量,我们提出了基于CLIP的分层专家过滤系统 (CLIP-MoE) 以去除不匹配的视频-产品对, resulting in a refined dataset of 224k training data and 25k evaluation data。为了评估数据集的可用性,我们进一步建立了全面的基准测试,通过评估几种最先进的视频视觉语言模型 (VLMs) 在属性条件值预测和开放属性值对提取任务下的表现。我们的结果分析显示,视频到文本 AVE 仍是一个具有挑战性的问题,尤其是在开放设置下,仍有足够的空间可以开发更先进的 VLMs 来有效利用时序信息。VideoAVE 数据集和基准代码可在:https://github.com/gjiaying/VideoAVE 获取。
引用
@article{arxiv.2508.11801,
title = {VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models},
author = {Ming Cheng and Tong Wu and Jiazhen Hu and Jiaying Gong and Hoda Eldardiry},
journal= {arXiv preprint arXiv:2508.11801},
year = {2025}
}
备注
5 pages, 2 figures, 5 tables, accepted in CIKM 2025