超越准确率:引入基于符号-机械主义的可解释评估方法
机器学习
2026-03-26 v1 人工智能
计算与语言
符号计算
摘要
准确率评估无法可靠区分真正的泛化与捷径(如记忆、泄漏或脆弱启发式方法),尤其在小数据情境下更为如此。本position paper我们认为,机械感知评估(mechanism-aware evaluation)应将与任务相关的符号规则与机械可解释性相结合,产生算法通过/失败评分,明确显示模型在哪里实现了泛化,哪里则利用了模式。我们在NL-to-SQL任务上进行演示,通过在两个相同架构下进行训练:一个不包含模式信息(迫使记忆),一个包含模式信息(启用 grounding)。标准评估显示,记忆模型在未见数据上达到94%的字段名准确率,错误地暗示了其 competence。我们的符号-机械主义评估揭示该模型违反了核心模式泛化规则,这一失败在准确率指标下完全不可见。
引用
@article{arxiv.2603.23517,
title = {Beyond Accuracy: Introducing a Symbolic-Mechanistic Approach to Interpretable Evaluation},
author = {Reza Habibi and Darian Lee and Magy Seif El-Nasr},
journal= {arXiv preprint arXiv:2603.23517},
year = {2026}
}