中文

群相对政策优化能否提升泰国法律推理与问答能力?

计算与语言 2025-07-15 v1

摘要

检索增强生成(RAG)系统在处理需要广泛且复杂法律推理的泰国法律问答任务方面仍存在局限,尤其是对于要求深度推理的问答。为此,我们引入一种方法,通过群相对政策优化(GRPO)对大语言模型进行对齐,以提高法律引用准确性和响应质量。我们的方法利用BGE-M3嵌入作为成本效益高的语义相似度奖励,显著降低计算成本,最高可降低至2.5倍。在NitiBench基准测试上的实验表明,GRPO实现了最高达90%的引用-F1提升,指令调优的联合质量指标提升了31%。关键的是,我们的方法在复杂法律推理任务上的鲁棒性优于指令调优,为增强泰国法律大语言模型提供了一种有效且高性价比的解决方案。

关键词

引用

@article{arxiv.2507.09638,
  title  = {Can Group Relative Policy Optimization Improve Thai Legal Reasoning and Question Answering?},
  author = {Pawitsapak Akarajaradwong and Chompakorn Chaksangchaichot and Pirat Pothavorn and Attapol Thamrongrattanarit-Rutherford and Ekapol Chuangsuwanich and Sarana Nutanong},
  journal= {arXiv preprint arXiv:2507.09638},
  year   = {2025}
}