面向实时开放词汇视频实例分割的挑战
计算机视觉与模式识别
2024-12-06 v1
摘要
本文解决了实时进行开放词汇视频实例分割(OV-VIS)的挑战问题。我们分析了最新面向 OV-VIS 的基础模型的计算瓶颈,并提出一种新方法 TROY-VIS,显著提升处理速度,同时保持高准确率。我们引入了三个关键技术:(1)解耦注意力特征增强器,用于加速不同模态和尺度之间的信息交互;(2)Flash 嵌入记忆,用于快速获取对象类别的文本嵌入;(3)核插值,用于利用视频中的时间连续性。我们的实验表明,TROY-VIS 在两大规模 OV-VIS 基准数据集 BURST 和 LV-VIS 上实现了准确率与速度之间的最佳权衡,运行速度比 GLEE-Lite 快 20 倍(25 FPS 对 1.25 FPS),准确率相当甚至更好。这些结果表明 TROY-VIS 在移动机器人和增强现实等动态环境中的实时应用具有潜力。代码和模型将在 https://github.com/google-research/troyvis 发布。
关键词
引用
@article{arxiv.2412.04434,
title = {Towards Real-Time Open-Vocabulary Video Instance Segmentation},
author = {Bin Yan and Martin Sundermeyer and David Joseph Tan and Huchuan Lu and Federico Tombari},
journal= {arXiv preprint arXiv:2412.04434},
year = {2024}
}