越南语AI生成文本检测
计算与语言
2024-05-07 v1 人工智能
摘要
近年来,大型语言模型(LLMs)已融入我们的日常生活,成为完成任务的宝贵助手。尽管被用户广泛接受,LLMs的滥用不可避免,特别是在用于生成各种目的的文本内容时,导致难以区分LLMs生成的文本和人类撰写的文本。在本研究中,我们提出了一个名为ViDetect的数据集,包含6,800个越南语作文样本,其中3,400个由人类撰写,其余由LLMs生成,用于检测AI生成的文本。我们使用最先进的方法进行了评估,包括ViT5、BartPho、PhoBERT、mDeberta V3和mBERT。这些结果不仅为AI生成文本检测的不断增长的研究做出了贡献,还展示了不同方法在越南语语境中的适应性和有效性。本研究为AI生成文本检测的未来进展奠定了基础,并为自然语言处理领域的研究人员提供了宝贵的见解。
引用
@article{arxiv.2405.03206,
title = {Vietnamese AI Generated Text Detection},
author = {Quang-Dan Tran and Van-Quan Nguyen and Quang-Huy Pham and K. B. Thang Nguyen and Trong-Hop Do},
journal= {arXiv preprint arXiv:2405.03206},
year = {2024}
}