AVC-DPO:基于直接偏好优化的对齐视频字幕
计算机视觉与模式识别
2025-07-03 v1
摘要
尽管视频多模态大语言模型 (video MLLM) 在视频字幕任务中取得了显著进展,但仍然面临如何根据人类偏好调整视频字幕焦点方面的挑战。为此,我们提出了一种名为对齐视频字幕通过直接偏好优化 (AVC-DPO) 的方法,这是一种旨在通过偏好对齐来增强视频 MLLM 字幕能力的后训练框架。我们设计了针对视频时序动态和空间信息——两个人类观看视频时关心的关键因素——的增强提示,从而整合了以人类为中心的偏好。AVC-DPO 利用同一基础模型在不同提示条件下的字幕生成响应进行偏好感知训练和字幕对齐。通过该框架,我们在 LOVE@CVPR'25 工作坊轨道 1A:视频详细字幕挑战赛中取得了优异成绩,根据 VDCSCORE 评估指标在视频详细字幕 (VDC) 基准上名列前茅。
引用
@article{arxiv.2507.01492,
title = {AVC-DPO: Aligned Video Captioning via Direct Preference Optimization},
author = {Jiyang Tang and Hengyi Li and Yifan Du and Wayne Xin Zhao},
journal= {arXiv preprint arXiv:2507.01492},
year = {2025}
}