Cockatiel:集成合成与人类偏好训练的详细视频描述
计算机视觉与模式识别
2025-03-13 v1
摘要
视频详细描述(VDC)是连接视觉与语言的关键任务,能够对复杂视频内容进行细粒度描述。在本文中,我们首先对当前最先进的方法进行了全面的基准测试,并系统地发现了两个关键局限性:对特定描述方面的能力存在偏差,以及与人类偏好的不一致。为了解决这些缺陷,我们提出了 Cockatiel,一种新颖的三阶段训练流水线,它集成了合成训练和人类对齐训练以提高 VDC 性能。在第一阶段,我们从精心标注的数据集中导出一个评分器,以选择在某些细粒度视频-描述对齐上表现良好且符合人类偏好而忽略其他方面的合成描述。然后,我们使用这个精选的数据集训练 Cockatiel-13B,为其注入组合的模型优势和人类偏好。最后,为了便于使用,我们进一步从 Cockatiel-13B 蒸馏出 Cockatiel-8B。大量的定量和定性实验反映了我们方法的有效性,我们不仅以维度平衡的方式在 VDCSCORE 上创造了新的最先进性能,而且如人类评估结果所示,在人类偏好上大幅超越了领先的替代方案。
引用
@article{arxiv.2503.09279,
title = {Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption},
author = {Luozheng Qin and Zhiyu Tan and Mengping Yang and Xiaomeng Yang and Hao Li},
journal= {arXiv preprint arXiv:2503.09279},
year = {2025}
}
备注
For more details, please refer to our project page: https://sais-fuxi.github.io/projects/cockatiel/