面向文本丰富图像的视觉问答的 Describe Anything 模型
计算机视觉与模式识别
2025-08-05 v2 机器学习
摘要
近期在区域感知视觉-语言建模方面取得了显著进展,尤其是 Describe Anything Model(DAM)的出现。DAM 能够在无需额外局部图像-文本对齐监督的情况下,生成任何特定图像区域或对象的详细描述。我们假设,这种区域级描述能力对视觉问答(Visual Question Answering, VQA)任务具有益处,尤其是在包含密集文本的图像中。在此类情境下,从图像中提取文本信息的细粒度至关重要以产生正确答案。基于此,我们引入 DAM-QA,一个针对文本丰富型 VQA 问题设计的评估框架,旨在探索和利用 DAM 的区域感知能力,以进行基于图像中文本信息的推理。DAM-QA 包含一种聚合来自多个区域视图图像内容答案的机制,从而更有效地识别可能与文本元素相关的证据。在六个 VQA 数据集上的实验表明,我们的方法持续优于基线 DAM,在 DocVQA 上取得显著的 7 分以上的提升。DAM-QA 还在参数更少的情况下实现了区域感知模型中最佳的整体性能,显著缩小了与强大通用视觉-语言模型之间的差距。这些结果凸显了当与高效使用和集成策略相结合时,DAM 类模型在文本丰富及更广泛 VQA 任务中的潜力。我们的代码已公开于 https://github.com/Linvyl/DAM-QA.git。
引用
@article{arxiv.2507.12441,
title = {Describe Anything Model for Visual Question Answering on Text-rich Images},
author = {Yen-Linh Vu and Dinh-Thang Duong and Truong-Binh Duong and Anh-Khoi Nguyen and Thanh-Huy Nguyen and Le Thien Phuc Nguyen and Jianhua Xing and Xingjian Li and Tianyang Wang and Ulas Bagci and Min Xu},
journal= {arXiv preprint arXiv:2507.12441},
year = {2025}
}
备注
11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025