中文

面向实时开放词汇视频实例分割的挑战

计算机视觉与模式识别 2024-12-06 v1

摘要

本文解决了实时进行开放词汇视频实例分割(OV-VIS)的挑战问题。我们分析了最新面向 OV-VIS 的基础模型的计算瓶颈,并提出一种新方法 TROY-VIS,显著提升处理速度,同时保持高准确率。我们引入了三个关键技术:(1)解耦注意力特征增强器,用于加速不同模态和尺度之间的信息交互;(2)Flash 嵌入记忆,用于快速获取对象类别的文本嵌入;(3)核插值,用于利用视频中的时间连续性。我们的实验表明,TROY-VIS 在两大规模 OV-VIS 基准数据集 BURST 和 LV-VIS 上实现了准确率与速度之间的最佳权衡,运行速度比 GLEE-Lite 快 20 倍(25 FPS 对 1.25 FPS),准确率相当甚至更好。这些结果表明 TROY-VIS 在移动机器人和增强现实等动态环境中的实时应用具有潜力。代码和模型将在 https://github.com/google-research/troyvis 发布。

关键词

引用

@article{arxiv.2412.04434,
  title  = {Towards Real-Time Open-Vocabulary Video Instance Segmentation},
  author = {Bin Yan and Martin Sundermeyer and David Joseph Tan and Huchuan Lu and Federico Tombari},
  journal= {arXiv preprint arXiv:2412.04434},
  year   = {2024}
}