中文

最大化泛化:不同数据增强技术对轻量级 Bengali 字符分类 Vision Transformer 的影响

计算机视觉与模式识别 2026-03-04 v1

摘要

深度学习模型在计算机视觉领域证明极为有效,深度卷积神经网络在各种计算机视觉任务上取得了令人印象深刻的结果。然而,这些模型高度依赖大规模数据集以避免过拟合。当模型学习到低或高方差特征时,可能导致在训练数据上发生欠拟合或过拟合。不幸的是,许多领域尤其是面向资源受限语言如孟加拉的大规模数据集可能并不可得。在本实验中,针对孟加拉手写字符的数据有限性问题,我们开展了一系列针对图像数据增强的测试。该研究还对不同增强技术的性能进行深入分析。数据增强是指对数据应用一系列技术以增加其规模和多样性,使其更适合训练深度学习模型。本研究评估的图像增强技术包括 CLAHE、随机旋转、随机仿射、颜色抖动及其组合。研究进一步探讨了这些增强方法与轻量级模型如 EfficientViT 的结合。就不同的增强策略而言,随机仿射与颜色抖动的组合在 Ekush [1] 和 AIBangla [2] 数据集上取得最佳准确率,分别达到 97.48% 和 97.57%。该组合在所有其他单个和组合增强技术中表现最佳。总体而言,本分析对在资源稀缺语言中应用图像数据增强进行了彻底的检视,特别是在使用轻量级模型进行孟加拉手写字符识别的语境下。

关键词

引用

@article{arxiv.2603.02591,
  title  = {Maximizing Generalization: The Effect of Different Augmentation Techniques on Lightweight Vision Transformer for Bengali Character Classification},
  author = {Rafi Hassan Chowdhury and Naimul Haque and Kaniz Fatiha},
  journal= {arXiv preprint arXiv:2603.02591},
  year   = {2026}
}