中文

迈向内容保护的抄袭检测第一步

密码学与安全 2020-05-26 v1 数字图书馆 信息检索

摘要

抄袭检测系统是维护学术与教育诚信的重要工具。然而,现有系统要求公开输入文档以及与输入文档进行比对的文档集合的全部内容。此外,这些系统是集中式的,并受控于个别(通常是商业性的)提供商。这种情况引发了关于敏感数据保密性的程序性和法律性关切,可能限制甚至禁止抄袭检测服务的使用。为消除当前系统的这些弱点,我们致力于设计一种既不需要集中式提供商、也不以明文形式暴露任何内容的抄袭检测方法。本文展示了我们研究的初步成果。具体而言,我们采用私有集合交集(Private Set Intersection)技术,为我们在抄袭检测系统 HyPlag 中实现的基于引文的相似度度量——文献耦合(Bibliographic Coupling)——设计了一种内容保护变体。我们的评估表明,该内容保护方法达到了与原方法相同的检测效果,同时使得旨在公开受保护内容的常见攻击在实际上不可行。我们未来的工作将通过设计能够分析文档全部内容而不以明文形式公开的抄袭检测方法,来扩展这一成功的原理验证。

关键词

引用

@article{arxiv.2005.11504,
  title  = {A First Step Towards Content Protecting Plagiarism Detection},
  author = {Cornelius Ihle and Moritz Schubotz and Norman Meuschke and Bela Gipp},
  journal= {arXiv preprint arXiv:2005.11504},
  year   = {2020}
}

备注

Submitted to JCDL 2020: Proceedings of the ACM/ IEEE Joint Conference on Digital Libraries in 2020 (JCDL '20), August 1-5, 2020, Virtual Event, China