T-COL:为可变机器学习系统上通用用户偏好生成反事实解释
人工智能
2026-02-03 v3
摘要
为应对机器学习(ML)系统中的可解释性挑战,反事实解释(CEs)已成为一种有前景的解决方案。CEs的独特性在于它们为用户提供可行的建议,而非解释为何预测了某一结果。CEs的应用面临两个主要挑战:通用用户偏好与可变ML系统。一方面,用户对特定值的偏好会随任务和场景而变化。另一方面,用于验证的ML系统可能在CEs执行期间发生改变。因此,用户偏好往往是通用的而非特定的,且CEs需要适应可变的ML模型,并在模型变化时保持鲁棒性。面对这些挑战,我们基于心理学与行为科学的见解提出通用用户偏好,并将非静态ML系统这一挑战作为一种偏好加入。此外,我们引入一种新方法,基于树的条件可选链接(T-COL),用于生成适应通用用户偏好的CEs。进而,我们利用T-COL在特定条件下增强CEs的鲁棒性,使CEs即便在ML模型被替换时仍保持鲁棒。为评估主观偏好,我们定义基于LLM的自主智能体来模拟用户并使其与真实用户对齐。实验表明,T-COL在适应通用用户偏好方面优于所有基线。
引用
@article{arxiv.2309.16146,
title = {T-COL: Generating Counterfactual Explanations for General User Preferences on Variable Machine Learning Systems},
author = {Ming Wang and Daling Wang and Wenfang Wu and Shi Feng and Yifei Zhang},
journal= {arXiv preprint arXiv:2309.16146},
year = {2026}
}