监管文本的信息检索与答案生成的混合方法
计算与语言
2025-02-25 v1
摘要
监管文本具有长度与复杂性,为信息检索系统在支持监管官员完成合规任务方面提出了重大挑战。本文引入一种混合信息检索系统,结合词典和语义搜索技术,从大规模监管语料库中提取相关信息。该系统将微调的句子转换模型与传统 BM25 算法相结合,以实现语义精度和词典覆盖。为生成准确且全面的响应,对检索到的段落在检索增强生成(RAG)框架内使用大型语言模型(LLM)进行合成。实验结果表明,混合系统在召回率(Recall@10)和平均检索精度(MAP@10)方面显著优于单一的词典或语义方法。通过公开分享我们的微调模型和方法,旨在推动自然语言处理工具在监管领域合规驱动应用的开发。
引用
@article{arxiv.2502.16767,
title = {A Hybrid Approach to Information Retrieval and Answer Generation for Regulatory Texts},
author = {Jhon Rayo and Raul de la Rosa and Mario Garrido},
journal= {arXiv preprint arXiv:2502.16767},
year = {2025}
}
备注
5 pages; Workshop paper; Proceedings of the 1st Regulatory NLP Workshop (RegNLP 2025)