基于双群直接偏好优化的文本-视频检索captioning
计算机视觉与模式识别
2025-09-23 v1
摘要
在文本-视频检索中,常用于增强视频理解的辅助caption,弥合了跨模态之间的差距。尽管多模态大语言模型(MLLM)的最新进展已实现强大的零样例caption生成,但我们注意到此类caption往往较为笼统,在视觉相似视频之间难以区分,限制了其用于细粒度检索的实用性。此外,传统captioning方法通常使用语言生成指标(如BLEU)进行评估,而这些指标不太适合需要在候选之间作出区分性判断的检索任务。为此,我们提出了CaRe-DPO,一个直接使用检索相关性分数优化caption生成的检索框架。其核心是双群直接偏好优化(DG-DPO),一种通过建模不同视频-caption对之间的偏好来监督captioning的新型学习策略。此外,我们呈现了一个集成角色嵌入的MLLM检索模型,以更好地区分具有不同功能角色的文本输入,如辅助caption和文本查询。通过大量实验,我们证明CaRe-DPO通过有效利用辅助知识为检索生成细粒度caption,显著提升了检索性能。代码已公开于https://github.com/mlvlab/CaReDPO。
引用
@article{arxiv.2509.16560,
title = {Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization},
author = {Ji Soo Lee and Byungoh Ko and Jaewon Cho and Howoong Lee and Jaewoon Byun and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2509.16560},
year = {2025}
}
备注
EMNLP 2025 Findings