中文

直接在 JPEG 压缩文档图像中自动进行文本行分割

计算机视觉与模式识别 2019-07-30 v1 图像与视频处理

摘要

JPEG 是流行的图像压缩算法之一,在消费电子中提供高效的存储和传输能力,因此它是互联网上最受偏好的图像格式。在当前数字和大数据时代,大量 JPEG 压缩文档图像正通过消费电子每日被归档和传输。尽管以压缩形式保存数据一方面具有优势,但另一方面使用现成方法进行处理在计算上代价高昂,因为它需要解压缩和再压缩操作。因此,如果在消费电子各自的压缩域中直接处理压缩数据,将是新颖且高效的。在本研究论文中,我们以打印文本行分割为例来展示这一思路。由于 JPEG 通过将图像在像素域中划分为不重叠的 8x8 块并使用离散余弦变换(DCT)来实现压缩,因此划分出的 8x8 DCT 块极有可能重叠两相邻文本行的内容而不留下任何行分隔线索,从而使文本行分割成为一项具有挑战性的问题。这里利用每个 8x8 DCT 块的 DC 投影轮廓和 AC 系数提出了两种分割方法。第一种方法基于选定 DCT 块的部分解压缩策略,第二种方法通过对 F10 和 F11 AC 系数进行智能分析且不使用任何类型的解压缩。所提方法已在可变字体大小、字体样式和行间距下测试,并报告了良好性能。

关键词

引用

@article{arxiv.1907.12219,
  title  = {Automatic Text Line Segmentation Directly in JPEG Compressed Document Images},
  author = {Bulla Rajesh and Mohammed Javed and P Nagabhushan},
  journal= {arXiv preprint arXiv:1907.12219},
  year   = {2019}
}

备注

Accepted in GCCE2019, Okinawa, Japan