文档图像中的类别无关感兴趣区域匹配
计算机视觉与模式识别
2025-06-27 v1
摘要
由于其广泛的应用,文档理解与分析受到了广泛关注。然而,现有的文档分析解决方案(如文档版面分析和关键信息提取)仅适用于固定的类别定义和粒度,无法实现用户自定义的灵活应用。因此,本文定义了一项名为“类别无关感兴趣区域匹配”(简称“RoI-Matching”)的新任务,旨在以灵活、高效、多粒度和开集的方式匹配自定义区域。参考文档和目标文档图像的视觉提示被输入到我们的模型中,而输出则是目标文档图像中对应的边界框。为了满足上述要求,我们构建了基准 RoI-Matching-Bench,它根据真实世界条件设定了三个难度级别,并提出了宏观和微观评估指标。此外,我们还提出了一个新框架 RoI-Matcher,它采用孪生网络在参考域和目标域中提取多级特征,并使用交叉注意力层来整合和对齐不同域中的相似语义。实验表明,我们采用简单流程的方法在 RoI-Matching-Bench 上是有效的,并可作为进一步研究的基线。代码可在 https://github.com/pd162/RoI-Matching 获取。
引用
@article{arxiv.2506.21055,
title = {Class-Agnostic Region-of-Interest Matching in Document Images},
author = {Demin Zhang and Jiahao Lyu and Zhijie Shen and Yu Zhou},
journal= {arXiv preprint arXiv:2506.21055},
year = {2025}
}
备注
Accepted by ICDAR2025