Domaino1s: 为高风险领域提供可解释答案的 LLM 推理引导
计算与语言
2025-05-29 v2 机器学习
摘要
大型语言模型 (LLM) 已被广泛应用于下游领域。然而,当前用于高风险领域任务的 LLM,如金融投资和法律问答,通常会生成简短答案,缺乏推理过程和解释,限制了用户基于其响应做出决策的信心。虽然原始的 CoT 方法取得了一些希望,但缺乏推理期间的自我纠正机制。本文引入 Domaino1s,通过监督微调和树搜索提升 LLM 在领域任务上的推理能力。我们构建 CoT-stock-2k 和 CoT-legal-2k 数据集进行微调,使模型根据判断激活领域特定推理步骤。此外,我们提出选择性树探索,以自主探索解空间并抽样最优推理路径以提升性能。我们还引入 PROOF-Score 作为评估领域模型可解释性的新指标,补充传统准确性指标。针对股票投资建议和法律推理问答任务进行大量实验,证明 Domaino1s 在领先性能和可解释性方面具有优势。我们的代码已公开于 https://github.com/Hyalinesky/Domaino1s。
引用
@article{arxiv.2501.14431,
title = {Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes Domains},
author = {Xu Chu and Zhijie Tan and Hanlin Xue and Guanyu Wang and Tong Mo and Weiping Li},
journal= {arXiv preprint arXiv:2501.14431},
year = {2025}
}