可编辑 XAI:面向双向人类- AI 对齐的可协作解释
人机交互
2026-02-16 v1
摘要
虽然可解释 AI (XAI) 有助于用户理解 AI 决策,但领域知识不一致可能导致误解。这类不一致阻碍理解,因为解释往往为只读格式,用户无法控制以改进对齐。我们提出使 XAI 可编辑,允许用户编写规则以提高控制并通过主动学习效应获得更深入的理解。我们开发的 CoExplain 利用神经网络实现通用表征,结合可解释属性上的符号规则进行直观推理。CoExplain 用忠实的决策树代理解释神经网络,将用户编写的规则解析为等效神经网络图,并协同优化决策树。在一次用户研究(N=43)中,CoExplain 和手动可编辑 XAI 较只读 XAI 显著提升了用户理解和模型对齐程度。CoExplain 使用更便捷,所需修改次数更少且耗时更短。本工作为双向 AI 对齐贡献了可编辑 XAI,提升理解与控制能力。
引用
@article{arxiv.2602.12569,
title = {Editable XAI: Toward Bidirectional Human-AI Alignment with Co-Editable Explanations of Interpretable Attributes},
author = {Haoyang Chen and Jingwen Bai and Fang Tian and Brian Y Lim},
journal= {arXiv preprint arXiv:2602.12569},
year = {2026}
}