ROSA:通过旋转采样解决照片中文字理解挑战
计算与语言
2025-06-05 v1 计算机视觉与模式识别
摘要
视障人士可从视觉问答(VQA)系统中受益,以解读周围环境中的文字。然而,现有模型在识别该群体拍摄的照片中的文字时常常遇到困难。通过与视障人士的深入访谈,我们识别出常见的构图惯例,这些惯例经常导致文字错位。现有的VQA基准主要包含由视力正常用户拍摄的正确朝向的文字,低估了这些挑战。为填补这一空白,我们引入了ROtated SAmpling(ROSA),一种解码策略,用于增强文字密集且文字朝向不正确的图像中的VQA性能。ROSA在表现最佳的模型上比贪心解码高出11.7个绝对百分点。
引用
@article{arxiv.2506.03665,
title = {ROSA: Addressing text understanding challenges in photographs via ROtated SAmpling},
author = {Hernán Maina and Guido Ivetta and Mateo Lione Stuto and Julian Martin Eisenschlos and Jorge Sánchez and Luciana Benotti},
journal= {arXiv preprint arXiv:2506.03665},
year = {2025}
}