从归因到行动:激活引导的人类中心应用
人工智能
2026-05-27 v2 人机交互
机器学习
摘要
可解释 AI(XAI)方法揭示哪些特征影响模型预测,但提供的有限方式让实践者能够行动。基于 XAI 识别的组件激活引导 offers 一种通向可操作解释的路径,尽管其实际实用性尚未得到充分研究。在本文中,我们引入一种结合 SAE 基于归因和激活引导的交互式工作流程,用于视觉模型中概念用途的实例级分析,实现为基于网页的工具。基于该工作流程,我们进行半结构化的专家访谈(N=8),就 CLIP 中的调试任务探讨专家如何 reason about、trust and apply activation steering。我们发现,引导使专家能够从检查转向基于干预的假设测试(8/8 参与者),大多数人信赖观察到的模型响应而非解释的可信度(6/8 )。参与者采纳了以组件抑制为主导的系统性调试策略(7/8),并强调包括涟漪效应和实例级纠正的有限泛化性等风险。总体而言,激活引导使可解释性更具可操作性,同时提出了关于安全有效使用的重要考虑事项。
引用
@article{arxiv.2604.11467,
title = {From Attribution to Action: A Human-Centered Application of Activation Steering},
author = {Tobias Labarta and Maximilian Dreyer and Katharina Weitz and Wojciech Samek and Sebastian Lapuschkin},
journal= {arXiv preprint arXiv:2604.11467},
year = {2026}
}