针对大型视觉语言模型数学文本识别的基于骨架化的对抗扰动
计算机视觉与模式识别
2026-01-09 v1
摘要
本工作通过引入一种利用骨架化有效缩减搜索空间的新型对抗攻击方法,探索了基础模型的视觉能力与局限性。我们的方法专门针对包含文本的图像,特别是数学公式图像,由于其LaTeX转换和复杂结构而更具挑战性。我们对原始输出和对抗扰动输出之间的字符和语义变化进行了详细评估,以提供对模型视觉解释和推理能力的洞察。通过将其应用于ChatGPT,进一步证明了我们方法的有效性,展示了其在真实世界场景中的实际意义。
引用
@article{arxiv.2601.04752,
title = {Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition},
author = {Masatomo Yoshida and Haruto Namura and Nicola Adami and Masahiro Okuda},
journal= {arXiv preprint arXiv:2601.04752},
year = {2026}
}
备注
accepted to ITC-CSCC 2025