生成任务中 LLM 解释的反事实可模拟性
计算与语言
2025-11-26 v3 人工智能
摘要
LLM 可能难以预测,因为即使对提示进行轻微修改,也可能导致输出以意想不到的方式发生变化。因此,模型准确解释其行为的能力至关重要,尤其是在高风险场景中。评估解释的一种方法是反事实可模拟性,即解释在多大程度上允许用户推断模型在相关反事实上的输出。反事实可模拟性此前已在是非问答任务中得到了研究。我们提供了一个将该方法扩展至生成任务的通用框架,并以新闻摘要和医疗建议作为示例用例。我们发现,尽管在摘要设置中 LLM 解释确实使用户能够更好地预测反事实上的 LLM 输出,但在医疗建议方面仍有很大的改进空间。此外,我们的结果表明,反事实可模拟性评估可能更适用于基于技能的任务,而非基于知识的任务。
引用
@article{arxiv.2505.21740,
title = {Counterfactual Simulatability of LLM Explanations for Generation Tasks},
author = {Marvin Limpijankit and Yanda Chen and Melanie Subbiah and Nicholas Deas and Kathleen McKeown},
journal= {arXiv preprint arXiv:2505.21740},
year = {2025}
}
备注
INLG25