基于时间接地桥的多模态大语言模型高效时间外推
计算机视觉与模式识别
2024-10-04 v2 计算与语言
摘要
尽管多模态大语言模型(MLLMs)取得了进展,但根据语言查询解释长视频的挑战依然存在,这主要是由于时间接地效率低下以及预训练上下文窗口大小有限。在这项工作中,我们引入了时间接地桥(TGB),这是一种新颖的框架,它引导MLLMs具备先进的时间接地能力并扩展其上下文范围。我们的框架通过三项关键创新显著增强了当前MLLMs的时间能力:一种应用于从光流投影出的低维时间特征的高效多跨度时间接地算法;一种利用低维时间特征扩展训练上下文窗口大小的多模态长度外推训练范式;以及一种无需标注即可将我们的模型与可插拔MLLMs桥接的引导框架。我们在七个视频基准上验证了TGB,并展示了与先前MLLMs相比显著的性能提升。值得注意的是,我们的模型最初在四帧序列上训练,能够有效处理长达16倍的序列而不牺牲性能,突显了其在实际应用中的可扩展性和有效性。我们的代码可在 https://github.com/bigai-nlco/VideoTGB 公开获取。
引用
@article{arxiv.2402.16050,
title = {Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge},
author = {Yuxuan Wang and Yueqian Wang and Pengfei Wu and Jianxin Liang and Dongyan Zhao and Yang Liu and Zilong Zheng},
journal= {arXiv preprint arXiv:2402.16050},
year = {2024}
}
备注
To appear at EMNLP 2024