基于大语言模型的块级文本定位
计算机视觉与模式识别
2024-06-21 v1
摘要
文本定位近年来取得了巨大进展,产生了能够在字符、单词或行级别提取文本的高性能技术。然而,从图像中提取文本块(块级文本定位)相对尚未被探索。块包含比单行、单词或字符更多的上下文,因此块级文本定位将增强下游应用,例如翻译,这些应用受益于增加的上下文。我们提出了一种新颖的方法,BTS-LLM(基于大语言模型的块级文本定位),用于在块级别识别文本。BTS-LLM包含三个部分:1)在行级别检测和识别文本,2)将行分组为块,以及3)使用大语言模型(LLM)找到块内行的最佳顺序。我们旨在利用LLM中强大的语义知识来实现准确的块级文本定位。因此,如果定位到的文本具有语义意义但在文本识别过程中被破坏,LLM也能够纠正文本中的错误并重建文本。
引用
@article{arxiv.2406.13208,
title = {Block-level Text Spotting with LLMs},
author = {Ganesh Bannur and Bharadwaj Amrutur},
journal= {arXiv preprint arXiv:2406.13208},
year = {2024}
}
备注
19 pages, 7 figures