在 ChatGPT 答案上应用标签模型提升法律文本蕴含性能
计算与语言
2024-02-01 v1
摘要
法律文本蕴含的目标是确定法律查询中的断言是否逻辑上遵循一篇或多篇法律条文提供的信息。ChatGPT 作为一个大型语言模型,在包括法律文本蕴含在内的许多自然语言处理任务中表现稳健:当我们将温度设为 0(ChatGPT 答案具有确定性)并提示模型时,它在 COLIEE 2022 数据集上达到了 70.64% 的准确率,优于之前 67.89% 的 SOTA。另一方面,如果温度大于零,ChatGPT 的答案是非确定性的,导致不一致的答案和波动的结果。我们提出利用标签模型(弱监督技术的基本组成部分)将 ChatGPT 的临时答案整合为统一的标签。通过这种方式,我们将 ChatGPT 的临时答案视为噪声预测,可由标签模型进行整合。实验结果表明,该方法可以达到 76.15% 的准确率,比之前的 SOTA 基准显著提高了 8.26%。此外,我们对 ChatGPT 产生错误答案的实例进行了分析,并对错误进行了分类,为未来研究工作的潜在改进提供了见解。
引用
@article{arxiv.2401.17897,
title = {Employing Label Models on ChatGPT Answers Improves Legal Text Entailment Performance},
author = {Chau Nguyen and Le-Minh Nguyen},
journal= {arXiv preprint arXiv:2401.17897},
year = {2024}
}
备注
15 pages