中文

微调大型语言模型以提高法律问答的事实性

计算与语言 2025-01-14 v1

摘要

幻觉,即生成不正确或捏造的信息,仍然是大型语言模型(LLM)面临的关键挑战,尤其是在法律问答(QA)等高风险领域。为了降低法律问答中的幻觉率,我们首先引入了一个名为LegalHalBench的基准测试和三个自动评估指标,用于评估LLM回答法律问题时常见的幻觉。然后,我们提出了一种幻觉缓解方法,该方法结合了行为克隆和一种新颖的难样本感知迭代直接偏好优化(HIPO)。我们进行了大量的真实数据实验来验证我们方法的有效性。我们的结果在各种指标上显示出显著改进,包括新提出的无幻觉法条率、法条相关率、法律主张真实性,以及传统指标如METEOR、BERTScore、ROUGE-L和胜率。

关键词

引用

@article{arxiv.2501.06521,
  title  = {Fine-tuning Large Language Models for Improving Factuality in Legal Question Answering},
  author = {Yinghao Hu and Leilei Gan and Wenyi Xiao and Kun Kuang and Fei Wu},
  journal= {arXiv preprint arXiv:2501.06521},
  year   = {2025}
}

备注

18 pages, 8 figures, to be published in COLING 2025