中文

策略学习中的解释设计:诱导无害反应的充分解释

人工智能 2025-05-29 v2

摘要

我们研究算法决策中面对策略性智能体(即可能根据决策者预测模型的解释修改其输入的个体)时的解释设计。随着对透明算法系统需求的持续增长,大多数先前工作将完全模型披露视为默认解决方案。然而在实践中,诸如金融机构等决策者通常仅通过解释来披露部分模型信息。这种部分披露可能导致智能体误解模型,并采取在不知情情况下损害其自身效用的行动。一个关键的开放问题是,决策者如何以既能避免伤害策略性智能体,又能支持其自身决策目标(例如最小化预测误差)的方式来传达解释。在这项工作中,我们分析了众所周知的解释方法,并建立了一个必要条件,以防止解释误导智能体采取自我伤害的行动。此外,在条件同质性假设下,我们证明了基于行动推荐的解释对于非有害响应是充分的,这反映了信息设计中的显示原理。为了展示基于行动推荐的解释如何在实践中操作,我们提出了一种联合优化预测模型和解释策略的简单学习过程。在合成和真实世界任务上的实验表明,基于行动推荐的解释使决策者能够优化其模型的预测性能,同时保持智能体的效用,为安全有效的部分模型披露提供了一种更精细的策略。

关键词

引用

@article{arxiv.2502.04058,
  title  = {Explanation Design in Strategic Learning: Sufficient Explanations that Induce Non-harmful Responses},
  author = {Kiet Q. H. Vo and Siu Lun Chau and Masahiro Kato and Yixin Wang and Krikamol Muandet},
  journal= {arXiv preprint arXiv:2502.04058},
  year   = {2025}
}