中文

Integrity Shield:用于评估中伦理 AI 使用与作者身份透明的系统

计算与语言 2026-01-19 v1

摘要

大型语言模型(LLMs)现在可以直接根据上传的 PDF 试卷解决整套考试,这引发了对学术诚信以及成绩和证书可靠性的迫切担忧。现有的水印技术要么在 token 级别运行,要么假定能控制模型的解码过程,这使得当学生使用教师提供的文档查询专有黑盒系统时,这些技术变得无效。我们提出了 Integrity Shield,这是一种文档层水印系统,它将模式感知的、题目级别的水印嵌入到评估 PDF 中,同时保持其人类可见的外观不变。这些水印持续阻止 MLLMs 回答受保护的考试 PDF,并编码稳定的、题目级别的签名,这些签名可以从模型或学生的回答中可靠地恢复。在涵盖 STEM、人文学科和医学推理的 30 场考试中,Integrity Shield 在四个商业 MLLMs 上实现了极高的阻止率(91-94% 的考试级别拦截)和强大的检测可靠性(89-93% 的签名检索率)。我们的演示展示了一个交互式界面,教师可以上传考试试卷、预览水印行为,并检查 AI 前后的表现与作者身份证据。

关键词

引用

@article{arxiv.2601.11093,
  title  = {Integrity Shield A System for Ethical AI Use & Authorship Transparency in Assessments},
  author = {Ashish Raj Shekhar and Shiven Agarwal and Priyanuj Bordoloi and Yash Shah and Tejas Anvekar and Vivek Gupta},
  journal= {arXiv preprint arXiv:2601.11093},
  year   = {2026}
}