中文

STARD:一个面向非专业用户真实查询的中文法律条文检索数据集

信息检索 2024-06-24 v1 计算与语言

摘要

法律条文检索旨在为特定查询找到相关的法律条文。这一过程是广泛的法律应用(如法律咨询、自动化司法决策、法律文件起草等)的基础。现有的法律条文检索基准数据集关注来自律师考试和法律案例文件的正式专业查询,从而忽略了来自普通大众的非专业查询,这些查询往往缺乏精确的法律术语和引用。为此,我们引入 STAtute Retrieval Dataset(STARD),一个由来自真实法律咨询的 1,543 个查询案例和 55,348 条候选法律条文组成的中文数据集。与现有的法律条文检索数据集不同,STARD 捕捉了来自普通大众真实查询的复杂性和多样性。通过对各种检索基线方法的全面评估,我们发现现有的检索方法在非专业用户提出的真实查询方面均表现不足。最佳方法仅达到 Recall@100 为 0.907,表明需要进一步探索和额外的研究。所有代码和数据集均可在 https://github.com/oneal2000/STARD/tree/main 获得。

关键词

引用

@article{arxiv.2406.15313,
  title  = {STARD: A Chinese Statute Retrieval Dataset with Real Queries Issued by Non-professionals},
  author = {Weihang Su and Yiran Hu and Anzhe Xie and Qingyao Ai and Zibing Que and Ning Zheng and Yun Liu and Weixing Shen and Yiqun Liu},
  journal= {arXiv preprint arXiv:2406.15313},
  year   = {2024}
}