降低 FLOPs:面向人类素描的高效网络
计算机视觉与模式识别
2025-05-30 v1
摘要
随着素描研究整体上的不断成熟,其面向大众的商业化应用已近在咫尺。尽管针对照片的高效推理研究已经成熟,但针对素描数据的高效推理尚无相关研究。在本文中,我们首先证明了为照片设计的现有最先进的高效轻量级模型无法直接应用于素描。随后,我们提出了两个特定于素描的组件,它们能以即插即用的方式作用于任何照片高效网络,使其适应素描数据。我们特别选择了细粒度基于素描的图像检索(FG-SBIR)作为演示,因为它是具有直接商业价值的最受认可的素描问题。从技术上讲,我们首先提出了一个跨模态知识蒸馏网络,将现有的照片高效网络转化为兼容素描的网络,这将 FLOPs 和模型参数分别降低了 97.96% 和 84.89%。然后,我们利用素描的抽象特性,引入了一个基于强化学习的画布选择器,该选择器能够动态适应抽象级别,从而进一步将 FLOPs 削减了三分之二。最终结果是,与完整网络相比,FLOPs 总体减少了 99.37%(从 40.18G 降至 0.254G),同时保持了准确率(33.03% 对 32.77%)——最终为稀疏的素描数据打造了一个高效网络,其 FLOPs 甚至低于最好的照片处理对应模型。
引用
@article{arxiv.2505.23763,
title = {Sketch Down the FLOPs: Towards Efficient Networks for Human Sketch},
author = {Aneeshan Sain and Subhajit Maity and Pinaki Nath Chowdhury and Subhadeep Koley and Ayan Kumar Bhunia and Yi-Zhe Song},
journal= {arXiv preprint arXiv:2505.23763},
year = {2025}
}
备注
Accepted at CVPR 2025, Project Page: https://subhajitmaity.me/SketchDownTheFLOPs