将错误作为镜头:通过合成误解生成探测 LLM 推理
数据库
2026-05-29 v1 分布式、并行与集群计算
操作系统
摘要
个性化辅导、教师培训和教育研究需要获取针对性的合成误解,但隐私和IRB约束使得标注的真实学生错误语料库稀缺。LLM在原则上可以大规模生成合成错误,但生成任意错误答案对现代LLM而言是容易的,而生成符合指定认知失效模式的错误答案则困难得多。我们提出了一个框架,用于生成针对改编自修订版布隆的taxonomy的五类误解进行评估,该框架在TheoremQA数据集的问题上进行评估。一个生成代理(Generation Agent, GA)根据目标类别生成候选错误解,一个检查代理(Examination Agent, EA)判断该草稿是否错误且符合类别一致性。该框架为在缺乏真实学生语料库的情境下构建具有类别层次的合成错误数据集提供了可复用的配方。作为次要诊断,针对性的错误生成显然比自由形式的错误答案生成更困难,答案 grounding 贡献大于扩展示例或外部教科书内容。
关键词
引用
@article{arxiv.2605.29006,
title = {IORM: Hierarchical I/O Governance for Thousands of Consolidated Databases on Oracle Exadata},
author = {Rajarshi Chowdhury and Akshay Shah and Zakaria Alrmaih and Chenhao Guo and Anubhav Singh and Sue Lee},
journal= {arXiv preprint arXiv:2605.29006},
year = {2026}
}
备注
13 pages, 4 figures, 6 tables. Accepted to appear in Proceedings of the VLDB Endowment (PVLDB), 2026