DALDALL:基于LLM-Persona面向法律领域的词汇与语义多样性数据增强框架
计算与语言
2026-03-25 v1 人工智能
信息检索
摘要
数据稀缺是低资源领域持久的挑战。虽然现有数据增强方法利用大语言模型(LLM)的生成能力产生大量合成数据,但这些方法往往侧重数量而忽视质量,且缺乏针对特定领域的策略。本文引入DALDALL,一套针对法律信息检索(IR)的persona-based数据增强框架。该方法运用领域专业persona——如律师、检察官及法官——生成合成查询,这些查询在词汇与语义多样性上显著优于常规提示方法。实验在CLERC和COLIEE基准上表明,基于persona的增强在Self-BLEU分数等词汇多样性指标上实现提升,同时保持语义对原查询的忠实性。此外,基于persona增强数据微调的稠密检索器在召回率上 consistently 取得竞争甚至优于原始数据或通用增强方法训练的模型。我们的发现表明,基于persona的提示策略是生成特定低资源领域高质量训练数据的有效方法。
引用
@article{arxiv.2603.22765,
title = {DALDALL: Data Augmentation for Lexical and Semantic Diverse in Legal Domain by leveraging LLM-Persona},
author = {Janghyeok Choi and Jaewon Lee and Sungzoon Cho},
journal= {arXiv preprint arXiv:2603.22765},
year = {2026}
}