中文

用于可解释商业决策的大语言模型:一种强化学习微调方法

计算与语言 2026-01-09 v1 人工智能

摘要

人工智能(AI)模型日益驱动着高风险消费者互动,然而其决策逻辑往往不透明。现有的可解释AI技术依赖于事后数值特征归因,无法提供模型决策背后的连贯叙述。大语言模型(LLM)为生成自然语言解释提供了机会,但仍有三个设计挑战尚未解决:解释必须既与决策正确性相符,又要忠实于驱动预测的因素;它们应能服务于多个受众,而不改变底层决策规则;并且它们应以标签高效的方式进行训练,不依赖于大规模人工评分解释语料库。为应对这些挑战,我们引入了LEXMA(基于LLM的多受众决策解释),一个基于强化学习的微调框架,可生成叙事驱动、适合受众的解释。LEXMA结合了反思增强的监督微调与两阶段组相对策略优化(GRPO)。具体而言,它微调两组独立的参数,以提高决策正确性并满足不同受众的风格要求,使用不依赖人工标注解释的奖励信号。我们在抵押贷款审批决策的背景下实例化了LEXMA。结果表明,与其他LLM基线相比,LEXMA在预测性能上取得了显著提升。此外,人工评估显示,我们方法生成的面向专家的解释更侧重于风险,而面向消费者的解释更清晰、更具可操作性且更有礼貌。我们的研究提供了一种经济高效、系统化的LLM微调方法,以提高商业决策的解释质量,为透明AI系统的可扩展部署提供了强大潜力。

关键词

引用

@article{arxiv.2601.04208,
  title  = {LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach},
  author = {Xiang Cheng and Wen Wang and Anindya Ghose},
  journal= {arXiv preprint arXiv:2601.04208},
  year   = {2026}
}