中文

深视觉模型空间注意力缺失的根本性局限:探索更高效视觉模型的路径

计算机视觉与模式识别 2024-11-25 v4 人工智能

摘要

本稿件的首要目标是强调当前深度学习模型,特别是视觉模型存在的显著局限。与人类视觉系统高效选择仅限于进一步处理的关键视觉区域,从而实现高速低能耗不同,深度视觉模型会处理整幅图像。本文从更广泛的视角审视此问题,并提出两种可能为下一代更高效视觉模型铺路的解决方案。第一种方案中,对 alteration 区域有选择性地应用卷积和池化操作,将 change map 发送至后续层;该 map 指示哪些计算需要重复。第二种方案中,仅由语义分割模型处理 modification 区域,然后将生成的 segment 插入到前一个输出 map 的对应区域。代码已公开于 https://github.com/aliborji/spatial_attention。

关键词

引用

@article{arxiv.2407.01782,
  title  = {Addressing a fundamental limitation in deep vision models: lack of spatial attention},
  author = {Ali Borji},
  journal= {arXiv preprint arXiv:2407.01782},
  year   = {2024}
}