TimeExpert:面向视频时间定位的专家引导视频大语言模型
计算机视觉与模式识别
2025-08-05 v1
摘要
视频时间定位(VTG)旨在响应文本查询精确识别视频事件片段。VTG任务的输出表现为事件序列,每个事件由精确的时间戳、显著性评分和文本描述定义。尽管近期进展取得了显著成果,但现有视频大语言模型(Video-LLMs)存在根本性局限:它们通过相同的静态路径处理所有任务标记,未能识别到时间局部化、显著性评估和文本生成代表 fundamentally 不同任务,需要专业处理。为此,我们引入TimeExpert,一个基于混合专家(MoE)的Video-LLM,通过动态路由任务特定标记(如时间戳、显著性评分)到专家,以实现高效的计算资源利用。我们的设计选择使得能够精确处理每个子任务,提升了在多样化VTG应用中的事件建模能力。大量实验表明,TimeExpert在各种VTG任务(如密集视频描述、时刻检索和视频高亮检测)中始终实现了最好的性能。
引用
@article{arxiv.2508.01699,
title = {TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding},
author = {Zuhao Yang and Yingchen Yu and Yunqing Zhao and Shijian Lu and Song Bai},
journal= {arXiv preprint arXiv:2508.01699},
year = {2025}
}