VDC-Agent:视频详细描述器如何通过智能体自反思自我进化
计算机视觉与模式识别
2025-11-25 v1 人工智能
机器学习
多媒体
摘要
我们提出VDC-Agent,一个无需人工标注或更大教师模型的视频详细描述自进化框架。该智能体形成描述生成、原则引导评分(评分与文本建议)以及提示精化的闭环。当描述质量下降时,自反思路径利用之前的链式思维来修正更新。在无标签视频上运行该过程可生成(描述,评分)对轨迹。我们将轨迹转换为偏好元组并过滤掉JSON解析错误的样本,得到VDC-Agent-19K,其中包含18,886个自动构建的对。随后我们使用由易到难的课程直接偏好优化在该数据集上微调基础MLLM。基于Qwen2.5-VL-7B-Instruct构建的VDC-Agent-7B在VDC基准上达到最先进的性能,平均准确率为49.08%,评分为2.50,超越了专用视频描述器,并在相似推理成本下相比基础模型提升+5.13%准确率和+0.27评分。
引用
@article{arxiv.2511.19436,
title = {VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection},
author = {Qiang Wang and Xinyuan Gao and SongLin Dong and Jizhou Han and Jiangyang Li and Yuhang He and Yihong Gong},
journal= {arXiv preprint arXiv:2511.19436},
year = {2025}
}