面向冰岛法律文本摘要的语言模型对齐
计算与语言
2025-04-28 v1 人工智能
机器学习
摘要
将语言模型集成到法律领域具有巨大的潜力,有助于简化流程并提高管理大量工作负载的效率。然而,法律文本的专门用语、细腻的语言表达以及正式的语体风格可能构成重大挑战。本研究检验了基于偏好的训练技术, Specifically 强化学习从人类反馈(Reinforcement Learning from Human Feedback, RLHF)和直接偏好优化(Direct Preference Optimization, DPO),是否能增强模型在生成符合领域语言标准和用户偏好的冰岛语法律摘要方面的性能。我们比较了使用偏好训练微调的模型与采用常规监督学习的模型。结果表明,偏好训练在提升生成摘要的法律准确性方面优于标准微调,但未显著提升冰岛语语言表达的整体质量。进一步地,自动评估指标与人类评估之间的差异进一步凸显了在开发面向法律领域的语言模型时,对定性评估的重要性。
引用
@article{arxiv.2504.18180,
title = {Aligning Language Models for Icelandic Legal Text Summarization},
author = {Þórir Hrafn Harðarson and Hrafn Loftsson and Stefán Ólafsson},
journal= {arXiv preprint arXiv:2504.18180},
year = {2025}
}
备注
Published at NoDaLiDa 2025