VideoPASTA:用于视频-LLM 对齐的 7K 偏好对
计算机视觉与模式识别
2025-09-26 v3
摘要
视频语言模型(Video-LLMs)在理解视频内容方面表现出色,但在空间关系、时间顺序和跨帧连续性方面存在挑战。为此,我们引入VideoPASTA(Preference Alignment with Spatio-Temporal-Cross Frame Adversaries),通过针对性偏好优化来增强Video-LLMs。VideoPASTA训练模型区分准确的视频表示与刻意违反空间、时间或跨帧关系的对抗性示例。仅凭 7020 个偏好对和直接偏好优化,VideoPASTA即可实现模型学习稳健表征,从而捕获细粒度空间细节和长程时间动态。实验表明,VideoPASTA对模型具有无偏好性,且在各种最先进的Video-LLMs上显著提升性能,例如在LongVideoBench上提升最高达 +3.8 个百分点,在VideoMME上提升 +4.1,在MVBench上提升 +4.0。这些结果表明,针对性对齐而非大规模预训练或架构修改,有效解决了视频语言挑战的核心问题。值得注意的是,VideoPASTA无需任何人工标注或标述,仅依赖 32 帧采样。这种效率使其成为一种可扩展的即插即用解决方案,无缝集成到现有模型中,同时保留其原始能力。
关键词
引用
@article{arxiv.2504.14096,
title = {VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment},
author = {Yogesh Kulkarni and Pooyan Fazli},
journal= {arXiv preprint arXiv:2504.14096},
year = {2025}
}
备注
EMNLP 2025 (Main)