AVoCaDO:基于时序编排驱动的听觉-视觉视频描述生成器
计算机视觉与模式识别
2025-10-14 v1
摘要
听觉-视觉视频描述生成旨在产生具有时序对齐的语义丰富描述,从而提升视频理解与生成能力。本文提出了AVoCaDO——一种基于音频与视觉模态之间时序编排驱动的听觉-视觉视频描述生成器。我们提出了两阶段后训练流程:(1) AVoCaDO SFT,通过微调获得10.7万组高质量、时序对齐的听觉-视觉视频描述;(2) AVoCaDO GRPO,通过量身设计的奖励函数进一步提升时序连贯性和对话准确性,同时正则化描述长度并减少模式崩溃。实验结果表明,AVoCaDO在四个听觉-视觉视频描述基准测试中显著优于现有开源模型,也在视觉-单模态设置下的VDC和DREAM-1K基准上取得具竞争力的性能。
引用
@article{arxiv.2510.10395,
title = {AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration},
author = {Xinlong Chen and Yue Ding and Weihong Lin and Jingyun Hua and Linli Yao and Yang Shi and Bozhou Li and Yuanxing Zhang and Qiang Liu and Pengfei Wan and Liang Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2510.10395},
year = {2025}
}
备注
Project webpage: https://avocado-captioner.github.io/