VS-Net:面向轻量级视频显著文档检测的多尺度时空特征网络
计算机视觉与模式识别
2023-01-12 v1 机器学习
摘要
视频显著文档检测(VSDD)是实用计算机视觉中的一项基本任务,旨在突出视频帧中视觉显著的文档区域。以往的 VSDD 技术侧重于学习特征,未考虑外观与运动线索之间及跨线索的协作,因而在实际场景中表现不佳。此外,以往大多数技术对计算资源需求较高,限制了此类系统在资源受限环境中的使用。为解决这些问题,我们提出 VS-Net,其借助空洞深度可分离卷积与近似秩池化(Approximation Rank Pooling)捕获多尺度时空信息。VS-Net 从各帧在嵌入子空间中局部提取关键特征,并在相邻与并行节点间传递特征,从而全局提升模型性能。我们的模型同时考虑背景与前景以生成显著图,使其在挑战性场景中表现更优。在基准 MIDV-500 数据集上开展的大量实验表明,VS-Net 模型在时间与鲁棒性指标上均优于当前最优方法。
引用
@article{arxiv.2301.04447,
title = {VS-Net: Multiscale Spatiotemporal Features for Lightweight Video Salient Document Detection},
author = {Hemraj Singh and Mridula Verma and Ramalingaswamy Cheruku},
journal= {arXiv preprint arXiv:2301.04447},
year = {2023}
}