VGTS:面向历史手稿中新颖类别的视觉引导文本定位
计算机视觉与模式识别
2024-04-01 v4 人工智能
摘要
在历史手稿研究领域,学者经常在古代文本中遇到新颖符号,并投入大量精力进行辨识与记录。尽管现有目标检测方法在已知类别上取得了令人印象深刻的性能,但它们难以在不重新训练的情况下识别新颖符号。为应对这一局限,我们提出一种视觉引导文本定位(VGTS)方法,仅使用一张带标注的支持样本即可准确 spotting 新颖字符。VGTS 的核心是一个由双空间注意力(DSA)块与几何匹配(GM)块组成的空间对齐模块。DSA 块旨在识别、聚焦并学习支持图像与查询图像中具有判别性的空间区域,模拟人类视觉 spotting 过程。它首先通过分析通道间关系来细化支持图像以定位关键区域,随后通过聚焦信息性关键点来细化查询图像。另一方面,GM 块建立两幅图像间的空间对应关系,从而在查询图像中精准定位目标字符。为解决低资源 spotting 任务中的样本不均衡问题,我们设计了一种新颖的环面损失函数,以增强嵌入空间在距离度量学习中的判别力。为进一步验证我们的方法,我们引入了一个包含中国纳西族古老东巴象形文字(DBH)的新数据集。在 DBH 数据集及其他公开数据集(包括 EGY、VML-HD、TKH 和 NC)上的大量实验表明,VGTS 持续超越 SOTA 方法。所提框架在历史手稿文本 spotting 中展现出巨大应用潜力,使学者能以极少的标注工作量高效辨识与记录新颖符号。
引用
@article{arxiv.2304.00746,
title = {VGTS: Visually Guided Text Spotting for Novel Categories in Historical Manuscripts},
author = {Wenbo Hu and Hongjian Zhan and Xinchen Ma and Cong Liu and Bing Yin and Yue Lu},
journal= {arXiv preprint arXiv:2304.00746},
year = {2024}
}