中文

一种用于教育教科书中历史偏见检测的智能体评估架构

人工智能 2026-04-10 v1 计算与语言 计算机与社会 多智能体系统

摘要

历史教科书常常包含难以大规模审计的隐性偏见、民族主义框架和选择性遗漏。我们提出了一种智能体评估架构,包括一个多模态筛选智能体、一个由五个评估智能体组成的异质陪审团,以及一个用于裁决综合和人工上报的元智能体。一个核心贡献是源属性协议,该协议区分教科书叙述与引用的历史来源,防止了导致单模型评估器中系统性误报的错误归因。在一项关于罗马尼亚高中历史教科书的实证研究中,270个筛选出的摘录中有83.3%被归类为教学上可接受的(平均严重程度2.9/7),而零样本基线为5.4/7,表明智能体审议减轻了过度惩罚。在一项盲人机评估(18名评估者,54次比较)中,独立审议配置在64.8%的情况下优于启发式变体和零样本基线。以每本教科书约2美元的成本,这些结果表明智能体评估架构可作为教育治理中经济可行的决策支持工具。

关键词

引用

@article{arxiv.2604.07883,
  title  = {An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks},
  author = {Gabriel Stefan and Adrian-Marius Dumitran},
  journal= {arXiv preprint arXiv:2604.07883},
  year   = {2026}
}

备注

Accepted for ITS(Intelligent Tutoring Systems) 2026 Full Paper