中文

基于残差适配器的高效多域文本识别深度神经网络参数化

计算机视觉与模式识别 2024-01-03 v1

摘要

深度神经网络的最新进展显著提升了计算机视觉任务的性能,但这些网络的专门化特性通常需要大量数据和较高的计算能力。为应对这些需求,本研究提出了一种新颖的神经网络模型,该模型擅长跨不同领域的光学字符识别(OCR),利用多任务学习的优势来提高效率和泛化能力。该模型旨在实现对新领域的快速适应,保持紧凑的尺寸以降低计算资源需求,确保高精度,保留先前学习经验的知识,并允许在不完全重新训练的情况下实现特定领域的性能提升。在开放数据集上的严格评估验证了该模型能够在不大幅牺牲性能的情况下显著减少可训练参数的数量,表明其作为计算机视觉领域(尤其是光学文本识别应用)中可扩展且适应性强的解决方案的潜力。

关键词

引用

@article{arxiv.2401.00971,
  title  = {Efficient Multi-domain Text Recognition Deep Neural Network Parameterization with Residual Adapters},
  author = {Jiayou Chao and Wei Zhu},
  journal= {arXiv preprint arXiv:2401.00971},
  year   = {2024}
}