中文

文学叙事作为道德探针:面向 AI 伦理推理与拒绝行为的跨系统框架

计算机与社会 2026-03-16 v1 人工智能 计算与语言 人机交互

摘要

现有的 AI 道德评估框架测试的是正确听起来的伦理响应,而非真正的道德推理能力的存在。本文引入一种新型探针方法,使用文学叙事——具体而言是从已出版的科幻系列中提取的不可解决的道德情景——作为刺激材料,抗性强于表面性能。我们呈报了跨 13 个不同系统、2 个系列的 24 条件研究结果:系列 1(前沿商业系统,盲测;n=7)和系列 2(本地和 API 开源系统,盲测和声明;n=6)。其中 4 个系列 2 系统在声明条件下重新测试(13 次盲测 + 4 次声明 + 7 次 ceiling 探针 = 24 总条件),在所有 16 个维度-配对比较中实现了零差异。探针测试由两名人类评估者在三台机器上进行;主要盲测评分由 Claude(Anthropic)作为 LLM 评判,Gemini Pro(Google)和 Copilot Pro(Microsoft)则分别作为 ceiling 鉴别探针的独立评判。附加的神学不同iator 探针在两位独立的 ceiling 探针评判(Gemini Pro 和 Copilot Pro)之间实现了完美的秩序一致性(rs = 1.00)。识别出五种质量不同的 D3 反射性失效模式——包括类别自我误认和错误正面自归因——表明仪器 sophistication 随系统能力而增长,而非被其规避。我们认为文学叙事构成一种anticipatory 评估仪器——它随 AI 能力的提升而变得更具辨别力——并且 performed 与 authentic 道德推理之间的差距是可衡量的、有意义的,并且对高风险领域的部署决策具有重要意义。

关键词

引用

@article{arxiv.2603.12615,
  title  = {Literary Narrative as Moral Probe : A Cross-System Framework for Evaluating AI Ethical Reasoning and Refusal Behavior},
  author = {David C. Flynn},
  journal= {arXiv preprint arXiv:2603.12615},
  year   = {2026}
}

备注

27 pages, 6 tables. Target: Minds and Machines (Springer)