中文

DoPE:面向学术完整性的人类可读、面向 AI 的考场文件中的去骗扰封装

计算与语言 2026-01-21 v1

摘要

多模态大语言模型(MLLMs)可以直接消费考试文件,威胁传统考核方式和学术完整性。我们提出 DoPE(Decoy-Oriented Perturbation Encapsulation,去骗扰封装),一种面向文档层面的防御框架,通过在 PDF/HTML 考试文件中嵌入语义迷惑信息来利用 MLLM 管道中的渲染-解析偏差。通过在 authoring 阶段对考试进行仪器化,DoPE 提供模型无关的防御(停止或干扰自动求解)和检测(标记盲目 AI 依赖)功能,无需依赖常规单次分类器。我们形式化了防御和检测任务,引入 FewSoRT-Q 用于生成问题级别的语义迷惑信息,并用 FewSoRT-D 将其封装为水印文档。我们在 Integrity-Bench 上进行评估,该基准包含 1826 份考试(PDF+HTML),源自公开 QA 数据集和 OpenCourseWare。针对来自 OpenAI 和 Anthropic 的黑盒 MLLMs,DoPE 实现了显著的实证提升:以 91.4% 检测率、8.7% 误报率使用 LLM-as-Judge 验证器检测,并在 96.3% 的尝试中防止成功完成或诱导迷惑信息对齐式失败。我们发布了 Integrity-Bench、工具包及评估代码,以支持可重复的文档层面防御学术完整性研究。

关键词

引用

@article{arxiv.2601.12505,
  title  = {DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity},
  author = {Ashish Raj Shekhar and Shiven Agarwal and Priyanuj Bordoloi and Yash Shah and Tejas Anvekar and Vivek Gupta},
  journal= {arXiv preprint arXiv:2601.12505},
  year   = {2026}
}