中文

TextlessRAG:基于语音的无文本端到端视觉文档检索增强生成

计算机视觉与模式识别 2025-09-11 v2

摘要

文档图像封装了丰富的知识,而语音查询的便携性使得更广泛和灵活的应用场景成为可能。然而,此前尚无工作探索过在视觉文档图像上,通过直接以语音提供的查询来进行知识库问答。我们提出了TextlessRAG,这是首个针对大规模文档图像的基于语音的问答端到端框架。与先前的方法不同,TextlessRAG消除了ASR、TTS和OCR,直接解释语音、检索相关的视觉知识,并在完全无文本的流程中生成答案。为了进一步提升性能,我们集成了一个布局感知的重排序机制来优化检索。实验表明,在效率和准确性方面都有显著提升。为了推动这一方向的研究,我们还发布了首个双语语音-文档RAG数据集,其中包含中文和英文语音查询,并与多模态文档内容配对。数据集和我们的流程都将在仓库中提供:https://github.com/xiepeijinhit-hue/textlessrag。

关键词

引用

@article{arxiv.2509.07538,
  title  = {TextlessRAG: End-to-End Visual Document RAG by Speech Without Text},
  author = {Peijin Xie and Shun Qian and Bingquan Liu and Dexin Wang and Lin Sun and Xiangzheng Zhang},
  journal= {arXiv preprint arXiv:2509.07538},
  year   = {2025}
}

备注

5 pages, 4 figures,