中文

机器是否如人类一样失败?面向模型-人类错误对齐的人类中心化外分布光谱

人工智能 2026-04-14 v2

摘要

判断 AI 系统是否以类似人类的方式处理信息是认知科学与可信赖 AI 的核心问题。虽然现代 AI 模型可在标准任务中达到人类水平,但这种准确性等同于其底层决策策略是否类似人类尚存疑问。采用误差对齐指标评估人类与模型的表现差异,以及这些差异随扭曲或更具挑战性刺激的变化,为更细致刻画模型-人类对齐提供了可行路径。然而,现有针对挑战性刺激的外分布(OOD)分析受限于方法选择:它们相对于模型训练数据定义 OOD 偏移,或使用与人类感知关联不大且参数任意的扭曲特定方式,阻碍原则性比较。我们提出人类中心化框架,将 OOD 程度重新定义为人类感知难度的光谱。通过量化刺激集合偏离无扭曲参考集的程度(基于人类准确率),构建 OOD 光谱并识别感知挑战的四个distinct regime。该方法使模型-人类比较在校准难度水平下实现原则性对齐。我们将该框架应用于目标识别,揭示在不同 OOD 条件下,深度学习架构呈现独特且取决于挑战 regime 的模型-人类对齐排名与配置。在近-OOD 与远-OOD 条件下,视觉-语言模型在人类对齐方面最为一致;但在近-OOD 条件下,卷积神经网络(CNN)比视觉Transformer(ViT)更贴近人类;在远-OOD 条件下,ViT 优于 CNN。我们的工作证明,考虑跨条件差异(如感知难度)对于原则性评估模型-人类对齐至关重要。

关键词

引用

@article{arxiv.2603.07462,
  title  = {Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment},
  author = {Binxia Xu and Xiaoliang Luo and Luke Dickens and Robert M. Mok},
  journal= {arXiv preprint arXiv:2603.07462},
  year   = {2026}
}