域自适应持续预训练在领域适应中的(不)必要性
计算与语言
2025-04-21 v1
摘要
近期在法律大型语言模型(LLM)领域的进展正在通过自动化任务、增强研究精度和支持复杂决策过程来改变法律研究和实践的格局。然而,有效地将LLM适应到法律领域仍然具有挑战性,这源于法律推理的复杂性、对专用语言的精确解释需求,以及可能的幻觉问题。本文考察了域自适应持续预训练(DACP)在提高LLM法律推理能力方面的有效性。通过在台湾法律框架内的法律推理任务上的一系列实验,我们展示了尽管DACP增强了领域特定知识,但并不一致地提高所有法律任务的性能。我们讨论了DACP所涉及的权衡,特别是其对模型泛化能力和基于提示的任务性能的影响,并提出了未来研究的方向,以优化法律AI中的领域适应策略。
引用
@article{arxiv.2504.13603,
title = {Continual Pre-Training is (not) What You Need in Domain Adaption},
author = {Pin-Er Chen and Da-Chen Lian and Shu-Kai Hsieh and Sieh-Chuen Huang and Hsuan-Lei Shao and Jun-Wei Chiu and Yang-Hsien Lin and Zih-Ching Chen and Cheng-Kuang and Eddie TC Huang and Simon See},
journal= {arXiv preprint arXiv:2504.13603},
year = {2025}
}
备注
11 pages, 2 figures