中文

利用大规模预训练语言模型构建法律题库以向公众普及法律知识

计算与语言 2025-05-08 v1 人工智能

摘要

获取法律信息是诉诸司法的基础。然而,可及性不仅指向公众提供法律文件,还指使法律信息易于他们理解。在向公众普及法律信息的过程中,一个棘手的问题是如何将通常高度技术性的正式法律文件(如立法和判决)转化为未受过法律教育者易于浏览和理解的知识。在本研究中,我们制定了一个三步法来向非专业人士普及法律知识,以解决可浏览性和可理解性问题。首先,我们将选定的法律章节翻译成片段(称为 CLIC 页面),每个片段都是一篇专注于用非专业术语解释特定技术性法律概念的小文章。其次,我们构建了一个法律题库(LQB),这是一个法律问题的集合,其答案可在 CLIC 页面中找到。第三,我们设计了一个交互式 CLIC 推荐器(CRec)。给定用户对需要法律解决方案的法律情境的口头描述,CRec 会解释用户的输入,从题库中筛选出最可能与给定法律情境相关的问题,并推荐其对应的 CLIC 页面,用户可在其中找到相关的法律知识。在本文中,我们重点关注创建 LQB 的技术方面。我们展示了如何使用大规模预训练语言模型(如 GPT-3)来生成法律问题。我们比较了机器生成问题(MGQ)与人工编写问题(HCQ),发现 MGQ 更具可扩展性、成本效益更高且更多样化,而 HCQ 更精确。我们还展示了 CRec 的原型,并通过一个例子说明了我们的三步法如何有效地向公众普及相关法律知识。

关键词

引用

@article{arxiv.2505.04132,
  title  = {Bringing legal knowledge to the public by constructing a legal question bank using large-scale pre-trained language model},
  author = {Mingruo Yuan and Ben Kao and Tien-Hsuan Wu and Michael M. K. Cheung and Henry W. H. Chan and Anne S. Y. Cheung and Felix W. H. Chan and Yongxi Chen},
  journal= {arXiv preprint arXiv:2505.04132},
  year   = {2025}
}