IF-VidCap:视频描述模型能否遵循指令?
计算机视觉与模式识别
2025-10-22 v1
摘要
虽然多模态大语言模型 (MLLM) 在视频描述方面已显示出专业能力,但实际应用需要生成遵循特定用户指令的描述,而非生成详尽且不受约束的描述。当前基准主要评估描述的全面性,却大体忽视了指令遵循能力。为此,我们引入 IF-VidCap,一个用于评估可控视频描述的新基准,包含 1,400 个高质量样本。与现有视频描述或通用指令遵循基准不同,IF-VidCap 包含系统化框架,评估维度包括格式正确性和内容正确性。我们对 20 多位著名模型进行全面评估,揭示了细致的格局:尽管专有模型仍主导,但性能差距正在缩小,顶级开源解决方案已接近或达到相当水平。此外,我们发现针对密集描述专门设计的模型在复杂指令下表现不如通用 MLLM,这表明未来工作应同时推进描述丰富性和指令遵循忠诚度。
引用
@article{arxiv.2510.18726,
title = {IF-VidCap: Can Video Caption Models Follow Instructions?},
author = {Shihao Li and Yuanxing Zhang and Jiangtao Wu and Zhide Lei and Yiwen He and Runzhe Wen and Chenxi Liao and Chengkang Jiang and An Ping and Shuo Gao and Suhan Wang and Zhaozhou Bian and Zijun Zhou and Jingyi Xie and Jiayi Zhou and Jing Wang and Yifan Yao and Weihao Xie and Yingshui Tan and Yanghai Wang and Qianqian Xie and Zhaoxiang Zhang and Jiaheng Liu},
journal= {arXiv preprint arXiv:2510.18726},
year = {2025}
}
备注
https://github.com/NJU-LINK/IF-VidCap