中文

基于卷积 LSTM 的视频序列语义分割

计算机视觉与模式识别 2024-10-30 v1 人工智能

摘要

大多数语义分割方法是为单图像分割而开发的,因此,目前视频序列的分割是通过分别处理视频序列的每一帧来实现的。其缺点在于未考虑时间图像信息,而该信息能够提升分割方法的性能。引入时间信息的一种可能性是使用循环神经网络。然而,迄今为止仅有少数方法将循环网络用于视频分割。这些方法扩展了知名分割方法的编码器-解码器网络架构,并在编码器和解码器之间放置卷积 LSTM 层。然而,本文表明该位置并非最优,网络中的其他位置展现出更好的性能。如今,SOTA 分割方法很少使用经典的编码器-解码器结构,而是使用多分支架构。这些架构更为复杂,因此更难将循环单元放置在合适的位置。在本工作中,我们在不同位置用卷积 LSTM 层扩展了多分支架构,并在两个不同的数据集上进行评估以寻找最佳位置。结果表明,所提出的方法比纯基于 CNN 的方法性能最多高出 1.6 个百分点。

关键词

引用

@article{arxiv.1905.01058,
  title  = {Semantic Segmentation of Video Sequences with Convolutional LSTMs},
  author = {Andreas Pfeuffer and Karina Schulz and Klaus Dietmayer},
  journal= {arXiv preprint arXiv:1905.01058},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication