HAUR:基于文本密集图像的人类注释理解与识别
计算机视觉与模式识别
2024-12-25 v1
摘要
视觉问答 (VQA) 任务利用图像传递关键信息以回答基于文本的问题,这是现实场景中最常见的问答形式之一。目前已存在许多视觉-文本模型并在特定 VQA 任务上表现良好。然而,这些模型在理解文本密集图像上的人类注释方面存在显著局限。为此,我们提出了人类注释理解与识别 (HAUR) 任务。作为本工作的一部分,我们引入了 Human Annotation Understanding and Recognition-5 (HAUR-5) 数据集,涵盖五种常见的人类注释类型。此外,我们开发并训练了 OCR-Mix 模型。通过全面的跨模型比较,结果表明 OCR-Mix 在该任务中优于其他模型。我们的数据集和模型将很快公开发布。
关键词
引用
@article{arxiv.2412.18327,
title = {HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images},
author = {Yuchen Yang and Haoran Yan and Yanhao Chen and Qingqiang Wu and Qingqi Hong},
journal= {arXiv preprint arXiv:2412.18327},
year = {2024}
}