中文

LMV-RPA:基于大模型投票的机器人流程自动化

机器人学 2025-04-29 v2 人工智能 软件工程

摘要

自动化高频率非结构化数据处理对于 operational efficiency至关重要。光学字符识别(OCR)是关键环节,但在复杂布局和模糊文本方面常常难以保证准确率和效率。这些挑战在需要速度与精度并存的大规模任务中尤为突出。本文引入了LMV-RPA,一种基于大模型投票的机器人流程自动化系统,用于提高OCR工作流程的准确率。LMV-RPA集成了来自Paddle OCR、Tesseract OCR、Easy OCR和DocTR等OCR引擎的输出,以及来自LLaMA 3和Gemini-1.5-pro等大型语言模型(LLM)。通过多数投票机制处理OCR输出,生成结构化JSON格式,提高准确率,尤其在复杂布局方面。多阶段管道将OCR引擎提取的文本通过LLM处理,组合结果以确保最准确的输出。LMV-RPA在OCR任务中实现了99%的准确率,显著超过基线模型的94%,同时将处理时间缩短80%。基准评估确认了其可扩展性,表明LMV-RPA提供了一个更快、更可靠、更高效的解决方案,用于自动化大规模文档处理任务。

关键词

引用

@article{arxiv.2412.17965,
  title  = {LMV-RPA: Large Model Voting-based Robotic Process Automation},
  author = {Osama Abdellatif and Ahmed Ayman and Ali Hamdi},
  journal= {arXiv preprint arXiv:2412.17965},
  year   = {2025}
}

备注

12 pages, 1 figures, 1 algorithm