KRETA:韩文文本丰富视觉问答基准测试集
计算机视觉与模式识别
2025-09-03 v2 计算与语言
摘要
理解和推理视觉上下文中的文本是视觉语言模型(Vision-Language Models, VLMs)面临的重要挑战,由于现实场景的复杂性和多样性。为解决这一挑战,文本丰富的视觉问答(Visual Question Answering, VQA)数据集和基准测试已涌现,主要针对像英语这样的高资源语言。然而,针对韩语等低资源语言的综合性基准测试仍存严重缺口,阻碍了模型评估和比较。为弥合这一差距,我们介绍 KRETA,这是一个针对韩文阅读与推理的文本丰富视觉问答基准测试,旨在适应多样化的视觉情境。KRETA 促进对视觉文本理解和推理能力的深入评估,同时支持跨15个领域和26种图像类型的多维度评估。此外,我们引入了一个针对文本丰富场景优化的半自动 VQA 生成管道,利用细化的分步图像分解和严格的七指标评估协议确保数据质量。虽然 KRETA 专为韩语设计,但我们希望可调整且可扩展的管道将促进其他语言类似基准测试的开发,从而加速多语言 VLM 研究。KRETA 的代码和数据集已提供于 https://github.com/tabtoyou/KRETA。
引用
@article{arxiv.2508.19944,
title = {KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts},
author = {Taebaek Hwang and Minseo Kim and Gisang Lee and Seonuk Kim and Hyunjun Eun},
journal= {arXiv preprint arXiv:2508.19944},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Main Conference)