中文

面向视频-文本大语言模型的音频-视觉训练以提升 grounding 能力

计算机视觉与模式识别 2024-07-23 v1 计算与语言 多媒体

摘要

近期多模态大语言模型的进展,催生了多个用于关键视频任务的视频-文本模型。然而,大多数先前工作仅支持视觉输入,实际上使视频中的音频信号静音。少数支持音频和视觉输入的模型,并未在音频数据上进行显式训练。因此,音频对视频理解的影响仍鲜有探索。为此,我们提出一种显式处理音频-视觉输入的模型架构。我们使用视频指令微调数据集中的音频和视觉数据进行训练。与视觉-only基线以及其他音频-视觉模型的比较表明,针对音频数据进行训练确实导致对响应的 grounding 能力提升。为更好地评估音频-视觉模型,我们还发布了一个由人工标注的基准数据集,包含音频感知的问答对。

关键词

引用

@article{arxiv.2407.15046,
  title  = {Audio-visual training for improved grounding in video-text LLMs},
  author = {Shivprasad Sagare and Hemachandran S and Kinshuk Sarabhai and Prashant Ullegaddi and Rajeshkumar SA},
  journal= {arXiv preprint arXiv:2407.15046},
  year   = {2024}
}