中文

1-800-SHARED-TASKS于 RegNLP:面向监管问答的语义检索词汇重排序(LeSeR)

计算与语言 2024-12-10 v1 信息检索 机器学习

摘要

本文介绍了我们为 COLING 2025 RegNLP RIRAG(监管信息检索与答案生成)挑战所提交的系统描述,重点在于利用先进的信息检索和答案生成技术处理监管领域问题。我们实验性地采用了多种嵌入模型,包括 Stella、BGE、CDE 和 Mpnet,并通过微调和重排序技术来检索相关文档的前N名结果。我们采用了一种新方法 LeSeR,在检索任务中取得了令人竞争的成绩,召回率@10(recall@10)为 0.8201,平均精确率@10(map@10)为 0.6655。本工作凸显了自然语言处理技术在监管应用中的变革性潜力,为在检索增强生成系统中实现监管问答提供了洞见,同时指出了在鲁棒性和领域适应性方面仍需改进的方向。

关键词

引用

@article{arxiv.2412.06009,
  title  = {1-800-SHARED-TASKS at RegNLP: Lexical Reranking of Semantic Retrieval (LeSeR) for Regulatory Question Answering},
  author = {Jebish Purbey and Drishti Sharma and Siddhant Gupta and Khawaja Murad and Siddartha Pullakhandam and Ram Mohan Rao Kadiyala},
  journal= {arXiv preprint arXiv:2412.06009},
  year   = {2024}
}

备注

5 pages, Accepted to RegNLP @ COLING 2025