弥合可解释人工智能的鸿沟——为何可靠的度量指标对可解释性与合规性至关重要
人工智能
2025-11-21 v2 计算工程、金融与科学
新兴技术
机器学习
摘要
可靠的可解释性不仅是技术目标,也是私域人工智能治理的基石。随着人工智能模型进入高风险领域,审计机构、保险公司、认证机构和采购机构等私主体需要标准化的评估指标来评判可信度。然而,当前的可解释人工智能评估指标仍然碎片化且易被操纵,这削弱了问责制与合规性。我们认为,标准化指标可作为治理原语,将可审计性与问责制嵌入人工智能系统,以实现有效的私主体监督。基于先前在可解释人工智能基准测试方面的工作,我们识别了在确保忠实性、抗篡改性和监管对齐方面的关键局限。此外,可解释性可通过提供一种可验证的手段来确保通用人工智能系统的行为完整性,从而直接支持模型对齐。可解释性与对齐之间的这种联系,将可解释人工智能指标定位为兼具技术与监管双重功能的工具,有助于防止对齐伪装这一监管机构日益关注的问题。我们提出一种“基于指标的治理”范式,将可解释性评估视为私域人工智能治理的核心机制。我们的框架引入了一个分层模型,将透明性、抗篡改性、可扩展性和法律对齐联系起来,将评估从模型内省扩展到系统层面的问责。通过概念综合并与治理标准对齐,我们勾勒出一条将可解释性指标整合到持续人工智能保障流程中的路线图,以满足私主体监督和监管的双重需求。
引用
@article{arxiv.2502.04695,
title = {Bridging the Gap in XAI-Why Reliable Metrics Matter for Explainability and Compliance},
author = {Pratinav Seth and Vinay Kumar Sankarapu},
journal= {arXiv preprint arXiv:2502.04695},
year = {2025}
}
备注
Accepted at first EurIPS Workshop on Private AI Governance