从沉默中倾听:基于视觉语言模型的无声视频音频描述推理
多媒体
2025-05-29 v3 声音
音频与语音处理
摘要
人类能够直观地从无声视频中推断出声音,但多模态大语言模型是否能够在不访问目标模态的情况下进行模态不匹配推理仍然鲜有探讨。当前的文本辅助视频到音频(VT2A)方法在视频脚丹任务中表现优异,但在推理阶段难以获取音频描述。我们提出了从无声视频推理音频描述(SVAD)的任务,以解决这一挑战,并探讨了视觉语言模型(VLM)在该任务上的能力。为进一步提升VLMs在SVAD任务上的推理能力,我们构建了CoT-AudioCaps数据集,提出了基于链式思维的监督微调策略。在SVAD和后续VT2A任务上的实验表明,我们的方法在两个关键方面均表现出色:显著提高了VLMs对SVAD任务的模态不匹配推理能力,有效解决了VT2A推理阶段获取音频描述的难题。
引用
@article{arxiv.2505.13062,
title = {Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model},
author = {Yong Ren and Chenxing Li and Le Xu and Hao Gu and Duzhen Zhang and Yujie Chen and Manjie Xu and Ruibo Fu and Shan Yang and Dong Yu},
journal= {arXiv preprint arXiv:2505.13062},
year = {2025}
}
备注
Accepted by Interspeech 2025