ESTR-CoT:基于思维链推理的可解释与精确事件流场景文本识别
计算机视觉与模式识别
2025-07-04 v1 人工智能
计算与语言
摘要
基于事件流的场景文本识别是近年来新兴的研究课题,在极富挑战性的场景(尤其是低照度与快速运动)下,其表现优于广泛使用的 RGB 摄像头。现有工作要么采用端到端编码器-解码器框架,要么利用大型语言模型增强识别,但仍受限于可解释性不足与上下文逻辑推理薄弱的挑战。本文提出一种新颖的基于思维链推理的事件流场景文本识别框架,称为 ESTR-CoT。具体而言,我们首先采用视觉编码器 EVA-CLIP (ViT-G/14) 将输入事件流转换为 token,并利用 Llama 分词器对给定的生成提示进行编码。使用 Q-former 将视觉 token 与预训练大型语言模型 Vicuna-7B 对齐,并同时输出答案与思维链推理过程。我们的框架可通过监督微调以端到端方式进行优化。此外,我们还提出了一个大规模 CoT 数据集,通过三阶段处理(即生成、润色与专家验证)来训练该框架。该数据集为后续基于推理的大型模型的发展提供了坚实的数据基础。在三个事件流 STR 基准数据集(即 EventSTR、WordArt*、IC15*)上的大量实验充分验证了本文所提框架的有效性与可解释性。源代码与预训练模型将发布于 https://github.com/Event-AHU/ESTR-CoT。
引用
@article{arxiv.2507.02200,
title = {ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning},
author = {Xiao Wang and Jingtao Jiang and Qiang Chen and Lan Chen and Lin Zhu and Yaowei Wang and Yonghong Tian and Jin Tang},
journal= {arXiv preprint arXiv:2507.02200},
year = {2025}
}
备注
A Strong Baseline for Reasoning based Event Stream Scene Text Recognition