HU 参加 SemEval-2024 任务 8A:对比学习能否学习嵌入以检测机器生成文本?
计算与语言
2024-03-29 v2 人工智能
机器学习
摘要
本文描述了我们要为 SemEval-2024 任务 8“多生成器、多领域和多语言黑盒机器生成文本检测”开发的系统。由于大语言模型(LLM)被用于生成虚假文本、网络钓鱼、考试作弊甚至抄袭版权材料,机器生成文本已成为主要关注点之一。许多系统已被开发用于检测机器生成文本。然而,这些系统大多依赖于文本生成模型。这种局限性在现实场景中不切实际,因为往往无法知道用户具体使用了哪个模型进行文本生成。在这项工作中,我们提出了一种基于对比学习的单一模型,其参数量仅为基线的约 40%(1.49 亿对 3.55 亿),但在测试数据集上表现出相当的性能(在 137 个参与者中排名第 21)。我们的关键发现是,即使没有多个模型的集成,借助数据增强和对比学习,单一基础模型也能具有相当的性能。我们的代码公开于 https://github.com/dipta007/SemEval24-Task8。
引用
@article{arxiv.2402.11815,
title = {HU at SemEval-2024 Task 8A: Can Contrastive Learning Learn Embeddings to Detect Machine-Generated Text?},
author = {Shubhashis Roy Dipta and Sadat Shahriar},
journal= {arXiv preprint arXiv:2402.11815},
year = {2024}
}
备注
Camera Ready Version - Accepted in SemEval 2024 (Colocated with NAACL 2024)