面向透明推理:何驱动大型语言模型的忠诚度?
计算与语言
2025-11-04 v2
摘要
大型语言模型(LLMs)常常产生的解释不忠实地反映其预测背后因素的影响。在医疗领域,此类不忠实性尤其 problematic:遗漏关键临床线索或掩盖虚假捷径的解释会削弱临床医生的信任并导致不安全的决策支持。我们研究推理和训练时选择如何影响解释忠诚度,聚焦于实践者可在部署时控制的因素。我们评估了三个 LLMs(GPT-4.1-mini、LLaMA 70B、LLaMA 8B)在两个数据集上的表现——BBQ(社会偏见)和 MedQA(医学执照考试问题),并操作化了 few-shot 示例的数量和类型、提示策略以及训练程序。我们的结果表明:(i)few-shot 示例的数量和质量显著影响模型的忠诚度;(ii)忠诚度对提示设计敏感;(iii)指令调优阶段改善了 MedQA 上的测量忠诚度。这些发现为增强 LLMs 在敏感领域的可解释性和可信度提供了策略性见解。
引用
@article{arxiv.2510.24236,
title = {Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?},
author = {Teague McMillan and Gabriele Dominici and Martin Gjoreski and Marc Langheinrich},
journal= {arXiv preprint arXiv:2510.24236},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling