VC-Agent:用于定制视频数据集收集的交互式智能体
人工智能
2025-09-26 v1 计算机视觉与模式识别
摘要
面对规模化法则,来自互联网的视频数据变得越来越重要。然而,收集满足特定需求的大量视频需要大量的人力和时间。本文研究了加速此过程的方法,提出了 VC-Agent——第一个能够理解用户查询和反馈,并据此检索/扩展相关视频片段的交互式智能体。具体而言,考虑到用户界面,我们的智能体定义了各种基于文本描述和确认的用户友好方式,以便用户指定需求。就智能体功能而言,我们利用现有的多模态大语言模型将用户需求与视频内容相连接。更重要的是,我们提出了两种可在持续用户交互时更新的新型过滤策略。最后,我们提供了一个用于个性化视频数据集收集的新基准,并仔细进行用户研究以验证该智能体在各种真实场景中的使用。大量实验表明,该智能体在定制视频数据集收集方面具有有效性和效率。项目页面:https://allenyidan.github.io/vcagent_page/。
引用
@article{arxiv.2509.21291,
title = {VC-Agent: An Interactive Agent for Customized Video Dataset Collection},
author = {Yidan Zhang and Mutian Xu and Yiming Hao and Kun Zhou and Jiahao Chang and Xiaoqiang Liu and Pengfei Wan and Hongbo Fu and Xiaoguang Han},
journal= {arXiv preprint arXiv:2509.21291},
year = {2025}
}
备注
Project page: https://allenyidan.github.io/vcagent_page/