SynPO:面向视频详细描述的描述性与偏好优化协同
人工智能
2026-03-24 v2 计算机视觉与模式识别
摘要
细粒度视频描述旨在生成详细且时间连贯的视频内容描述。然而,现有方法难以捕捉微妙的视频动态和丰富的细节信息。本文利用偏好学习来增强视觉语言模型在细粒度视频描述中的性能,同时缓解直接偏好优化(DPO)固有的若干局限性。首先,我们提出了一种构建偏好对的流程,利用 VLM 的内在特性以及大语言模型的部分辅助,在成本与数据质量之间取得最佳平衡。其次,我们提出了协同偏好优化,一种相比 DPO 及其变体具有显著优势的新颖优化方法。SynPO 可防止负偏好主导优化过程,显式保留模型的语言能力以避免优化目标偏离,并通过消除对参考模型的需求来提高训练效率。我们不仅在视频描述基准(如 VDC、VDD、VATEX)上广泛评估了 SynPO,还使用多种预训练模型在成熟的 NLP 任务(包括通用语言理解和偏好评估)上进行了评估。结果表明,SynPO 始终优于 DPO 变体,同时训练效率提升了 20%。代码可在 https://github.com/longmalongma/SynPO 获取。
引用
@article{arxiv.2506.00835,
title = {SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning},
author = {Jisheng Dang and Yizhou Zhang and Hao Ye and Teng Wang and Siming Chen and Huicheng Zheng and Yulan Guo and Jianhuang Lai and Bin Hu},
journal= {arXiv preprint arXiv:2506.00835},
year = {2026}
}