中文

ROSA:通过旋转采样解决照片中文字理解挑战

计算与语言 2025-06-05 v1 计算机视觉与模式识别

摘要

视障人士可从视觉问答(VQA)系统中受益,以解读周围环境中的文字。然而,现有模型在识别该群体拍摄的照片中的文字时常常遇到困难。通过与视障人士的深入访谈,我们识别出常见的构图惯例,这些惯例经常导致文字错位。现有的VQA基准主要包含由视力正常用户拍摄的正确朝向的文字,低估了这些挑战。为填补这一空白,我们引入了ROtated SAmpling(ROSA),一种解码策略,用于增强文字密集且文字朝向不正确的图像中的VQA性能。ROSA在表现最佳的模型上比贪心解码高出11.7个绝对百分点。

关键词

引用

@article{arxiv.2506.03665,
  title  = {ROSA: Addressing text understanding challenges in photographs via ROtated SAmpling},
  author = {Hernán Maina and Guido Ivetta and Mateo Lione Stuto and Julian Martin Eisenschlos and Jorge Sánchez and Luciana Benotti},
  journal= {arXiv preprint arXiv:2506.03665},
  year   = {2025}
}