神经透明性:面向个性化AI的机制可解释性界面
人机交互
2025-11-25 v2 人工智能
摘要
数以百万计的用户现在设计基于大语言模型的个性化聊天机器人,以塑造日常交互,但他们只能大致预估设计选择在部署时将表现为何种行为。这种不透明性是有影响的:看似无害的提示可能触发过度迎合、有害或其他不良特征,降低实用性并引发安全问题。为此,我们引入了一个界面,通过暴露聊天机器人设计期间的语言模型内部机制,实现神经透明性。我们的ethods通过计算对比系统提示(产生相互对立行为)之间的神经激活差异来提取行为特征向量(如同理心、有害、迎合性等)。我们通过将系统提示的最终标记激活投影到这些特征向量上,进行跨特征可比性归一化,并通过交互式 sunburst 图可视化结果来预测聊天机器人行为。为评估该方法,我们使用Prolific进行在线用户研究,将我们的神经透明性界面与没有任何透明性形式的基准聊天机器人界面进行比较。我们的分析表明,用户系统性地误校准了AI行为:在15个可分析的特征中,参与者对11个特征的激活程度误判了,这促使了透明工具在日常人机交互中的需求。尽管我们的界面未改变设计迭代模式,但显著增加了用户信任,且接受度热烈。定性分析揭示了用户对该可视化的细微体验,表明未来工作需要改进界面和交互方式。本工作为如何为非技术用户操作化机制可解释性提供了路径,为更安全、更契合的人机交互奠定了基础。
引用
@article{arxiv.2511.00230,
title = {Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI},
author = {Sheer Karny and Anthony Baez and Pat Pataranutaporn},
journal= {arXiv preprint arXiv:2511.00230},
year = {2025}
}
备注
SK and AB are co-first authors