利用伪未修剪视频赋能大语言模型进行视听时间理解
计算机视觉与模式识别
2025-10-09 v3 人工智能
摘要
大语言模型(LLMs)在自然语言和多模态领域展示了卓越的能力。通过使用来自良好标注数据集(例如密集视频描述数据集)的时间注释微调多模态 LLMs,可以获得它们在视频-语言任务中的时间理解能力。然而,目前明显缺乏具有精确事件时间注释的未修剪视听视频数据集。这一不足阻碍了 LLMs 学习时间、视听事件和文本标记之间的对齐,从而削弱了它们在视频中时间定位视听事件的能力。为了解决这一差距,我们引入了 PU-VALOR,一个全面的视听数据集,包含超过 114,000 个带有详细时间注释的伪未修剪视频。PU-VALOR 源自大规模但粗标注的视听数据集 VALOR,通过一种涉及基于事件的视频聚类、随机时间缩放和排列的微妙方法生成。通过在 PU-VALOR 上微调一个多模态 LLM,我们开发了 AVicuna,一个能够将视听事件与时间间隔和相应文本标记对齐的模型。AVicuna 在时间定位和时间感知对话能力方面表现出色。我们的实验表明,AVicuna 有效地处理了视听视频中的时间理解,并在开放式视频问答、视听问答和视听事件密集定位任务上达到了最先进的性能。
引用
@article{arxiv.2403.16276,
title = {Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding},
author = {Yolo Yunlong Tang and Daiki Shimada and Jing Bi and Mingqian Feng and Hang Hua and Chenliang Xu},
journal= {arXiv preprint arXiv:2403.16276},
year = {2025}
}
备注
Accepted to AAAI 2025