基于统计与语义分析技术的图像内容文本相似度检测
计算与语言
2023-08-25 v1
摘要
剽窃检测是自然语言处理(NLP)领域研究最多的方向之一。良好的剽窃检测涵盖所有 NLP 方法,包括语义、命名实体、释义等,并生成详细的剽窃报告。跨语言剽窃检测需要各种先进方法与算法的深入知识以执行有效的文本相似度核查。如今,剽窃者也在不断提升自己以隐藏身份、避免被查获。他们通过释义、同义词替换、引用错配、语言翻译等手段逃避检测。图像内容剽窃检测(ICPD)已变得重要,它利用先进的图像内容处理来识别剽窃实例,以保障图像内容的完整性。剽窃问题不限于文本内容,图像如图形、图表和表格也有被剽窃的可能。然而,图像内容剽窃检测仍是一项未被解决的挑战。因此,亟需开发用于检测图像内容中剽窃的方法和系统。本文实现了从图像内容(如图形、图表、表格等)中检测剽窃的系统。除 Jaccard 和 Cosine 等统计算法外,引入 LSA、BERT、WordNet 等语义算法,在高效、准确的剽窃检测中表现更优。
引用
@article{arxiv.2308.12842,
title = {Text Similarity from Image Contents using Statistical and Semantic Analysis Techniques},
author = {Sagar Kulkarni and Sharvari Govilkar and Dhiraj Amin},
journal= {arXiv preprint arXiv:2308.12842},
year = {2023}
}
备注
NLPTT2023 publication, 10 Pages