LION-FS:快速与慢速视频语言思考者作为在线视频助手
计算机视觉与模式识别
2025-03-07 v2
摘要
第一人称视频助手备受期待,能够通过在线视频对话提升我们的日常生活。然而,现有的在线视频助手往往通过处理低帧率视频和粗粒度视觉特征来牺牲辅助效果以换取实时效率。为克服效果与效率之间的权衡,我们提出了'快速与慢速视频语言思考者'作为在线视频助手LION-FS,实现了实时、主动、时间精确和上下文精确的响应。LION-FS采用两阶段优化策略:1)快速路径:基于路由的响应判定逐帧评估是否需要立即响应。为提高响应判定准确性并高效处理更高帧率输入,我们采用Token聚合路由在不增加token数量的情况下动态融合时空特征,同时利用Token丢弃路由消除冗余特征。2)慢速路径:多粒度关键帧增强在响应生成过程中优化关键帧。为提供超越训练数据约束的原子动作的全面且详细的响应,通过多粒度池化提取细粒度空间特征和人与环境交互特征。这些特征进一步被整合到精心设计的多模态思考模板中,以指导更精确的响应生成。在在线视频任务上的全面评估表明,LION-FS实现了最先进的辅助效果和效率。
引用
@article{arxiv.2503.03663,
title = {LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant},
author = {Wei Li and Bing Hu and Rui Shao and Leyang Shen and Liqiang Nie},
journal= {arXiv preprint arXiv:2503.03663},
year = {2025}
}
备注
Accept to CVPR 2025, Project page: https://github.com/JiuTian-VL/LION-FS