中文

超越语义相似性:面向企业信用审批的双相非参数检索工作流程

计算与语言 2026-05-21 v1

摘要

企业信用审批需要分析师从横跨数百页且多语言的长篇异构财务文件中提取可操作证据。标准的检索增强生成 (RAG) 流程针对语义相似性进行优化,常常会呈现与主题相关但缺乏决策效用性的段落,这一问题我们称为相似性-效用性差距。我们提出一种双相非参数检索架构,将高召回候选检索与高精度效用排序分离。第一阶段结合词法检索和密集多语言检索构建宽广的候选池。第二阶段应用自适应检索控制器,使用查询意图和文档结构信号过滤候选,然后通过 LLM 作为评判的效用评分机制,对段落按分析实用性进行排序而非语义接近性。一个上下文感知的提取模块保留跨叙述文本和复杂财务表格的结构保真度。该系统完全部署在本地,以满足企业数据治理要求。在针对带有分析师精选相关性标签的多语言专有财务文件语料库上的评估中,该系统显著优于朴素检索基线。在超过 800 名信用分析师的实际部署中,文档审阅时间从数小时缩短至约三分钟,展示了面向文档密集型决策支持工作流程的效用感知 RAG 架构的实际价值。

关键词

引用

@article{arxiv.2605.20684,
  title  = {Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting},
  author = {Linus Ng Junjia and Ezekiel Tee Kongquan and Kelvin Heng and Kenneth Zhu Ke and Zhao Jing Yuan},
  journal= {arXiv preprint arXiv:2605.20684},
  year   = {2026}
}