OneNet:一种逐通道一维卷积 U-Net
图像与视频处理
2024-11-18 v1 计算机视觉与模式识别
摘要
许多最先进的计算机视觉架构利用 U-Net 因其适应性和高效的特征提取。然而,多分辨率卷积设计往往导致巨大的计算需求,限制了在边缘设备上的部署。我们提出了一种精简替代方案:一种一维卷积编码器,在保持精度的同时增强其对边缘应用的适用性。我们的新颖编码器架构通过逐通道一维卷积与像素反混洗操作相结合实现语义分割。通过引入 PixelShuffle(因在超分辨率任务中提高精度同时降低计算负载而闻名),OneNet 在不需要二维卷积的情况下捕捉空间关系,将参数量减少高达 47%。此外,我们探索了一种全一维编码器-解码器,实现了 71% 的模型大小缩减,尽管伴随一定精度损失。我们在多样的掩码生成任务上与 U-Net 变体进行基准测试,证明其有效保持了精度。尽管专注于图像分割,该架构可适应其他卷积应用。代码可在 https://github.com/shbyun080/OneNet 获取。
引用
@article{arxiv.2411.09838,
title = {OneNet: A Channel-Wise 1D Convolutional U-Net},
author = {Sanghyun Byun and Kayvan Shah and Ayushi Gang and Christopher Apton and Jacob Song and Woo Seong Chung},
journal= {arXiv preprint arXiv:2411.09838},
year = {2024}
}