利用TF-IDF和BERT嵌入的加权集成增强低资源语言马拉地语的抄袭检测
计算与语言
2025-01-10 v1 人工智能
机器学习
摘要
抄袭是指未经适当归属而使用他人的作品或概念,并将其呈现为原创作品。随着马拉地语(印度的一种地区语言)等地区语言中数据量的增长,为低资源语言设计鲁棒的抄袭检测系统变得至关重要。像BERT(来自Transformer的双向编码器表示)这样的语言模型在文本表示和特征提取方面表现出了卓越的能力,使其成为语义分析和抄袭检测的重要工具。然而,BERT在低资源语言中的应用仍然探索不足,特别是在抄袭检测的背景下。本文提出了一种方法,通过使用BERT句子嵌入结合词频-逆文档频率(TF-IDF)特征表示,来提高马拉地语文本抄袭检测的准确性。该方法通过机器学习模型的加权投票集成,有效捕捉文本特征的统计、语义和句法方面。
引用
@article{arxiv.2501.05260,
title = {Enhancing Plagiarism Detection in Marathi with a Weighted Ensemble of TF-IDF and BERT Embeddings for Low-Resource Language Processing},
author = {Atharva Mutsaddi and Aditya Choudhary},
journal= {arXiv preprint arXiv:2501.05260},
year = {2025}
}
备注
Accepted into LoResLM: The First Workshop on Language Models for Low-Resource Languages, colocated with COLING 2025 and set to be published into ACL Anthology